Esc to close · ⌘K / Ctrl-K opens search anywhere
tiered प्लेबुक: डीफॉल्टनुसार सर्वात स्वस्त India route, optimize:price, नियमित काम छोट्या मॉडेल्सना सोपवा, cheap-first fallback, आणि quality खर्च फक्त त्याच कॉल्सवर जे त्यास पात्र आहेत.
optimize:price + delegation + BYOEखर्चमध्यम12 min
बहुतांश टीम प्रत्येक request एका महागड्या मॉडेलकडे पाठवून गरजेपेक्षा जास्त खर्च करतात — त्या 80% कॉल्ससह (classification, extraction, छोटे drafts, retries) ज्या एखादे स्वस्त मॉडेल तितक्याच चांगल्या प्रकारे हाताळते. हीच ती tiered प्लेबुक आहे जिच्यामुळे बिल कितीतरी पटीने कमी होते, मात्र महत्त्वाच्या कॉल्सवरील quality न गमावता.
optimize: "price" ला सर्वात स्वस्त healthy route निवडू द्या — आपोआप.अंगठ्याचा नियम: एखाद्या request ला premium मॉडेल तेव्हाच हवे जेव्हा माणूस आउटपुटमधला फरक ओळखेल. बहुतांश वेळी ओळखत नाही.
BharatRouter वर gemma-4-e4b-it हा सर्वात स्वस्त India-resident chat route आहे — नियमित कामासाठी एक समजूतदार डीफॉल्ट. तुमचा सध्याचा OpenAI code दोन ओळी बदलून यावर लावा:
from openai import OpenAI
client = OpenAI(base_url="https://api.bharatrouter.com/v1", api_key="br-...")
resp = client.chat.completions.create(
model="gemma-4-e4b-it",
messages=[{"role": "user", "content": "Classify this ticket: 'app won\u2019t open after update'"}],
)
print(resp.choices[0].message.content)जेव्हा एखाद्या मॉडेलचे एकाहून अधिक route असतील, तेव्हा optimize: "price" input + output ₹/Mtok नुसार रँक करून request सर्वात स्वस्त healthy route कडे पाठवते, कोणताही open-circuit route वगळून. हे डीफॉल्ट आहे, पण ते स्पष्ट ठेवा — India-resident राहूनच cheapest-first साठी data_policy: "india_only" जोडा:
resp = client.chat.completions.create(
model="gemma-4-e4b-it",
messages=[{"role": "user", "content": "Summarise in two lines: ..."}],
extra_body={"optimize": "price", "data_policy": "india_only"},
)सर्वात मोठी बचत sub-tasks साठी महागड्या मॉडेलला न बोलावल्याने होते. एक छोटे मॉडेल नियमित पायऱ्या करते; फक्त खरोखर कठीण request मोठ्या मॉडेलकडे जाते. एकाच client मधून per-call मॉडेल निवडा — model id हे फक्त एक string आहे:
def ask(model, prompt):
return client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
extra_body={"optimize": "price"},
).choices[0].message.content
# Routine: cheapest route
intent = ask("gemma-4-e4b-it", f"Intent of: {user_msg}? One word.")
# Hard reasoning only when it matters
if intent == "complex_support":
answer = ask("gpt-5", build_prompt(user_msg))
else:
answer = ask("gpt-5-mini", build_prompt(user_msg))विश्वासार्हता आणि खर्च हे एकच लीव्हर आहेत जर chain चा क्रम बरोबर असेल: सर्वात स्वस्त route आधी, premium मॉडेल फक्त शेवटचे सुरक्षा-जाल. अपयशावर router chain वर चालतो, त्यामुळे महाग route तेव्हाच स्पर्शला जातो जेव्हा बाकी सर्व डाउन असतात. हे एकदा Collection म्हणून जतन करा जेणेकरून सामान्य requests ते इनहेरिट करतील.
खरोखर मोफत tier हवा आहे? तुमचे OpenAI-compatible deployment (vLLM, Ollama इत्यादी) BYOE endpoint म्हणून register करा — ते ₹0 वर serve होते आणि तुमच्या fallback chain च्या पहिल्या पायरी म्हणून जोडले जाते, मागे paid routes फक्त backup साठी. seller onboarding आल्यावर self-hosted open-weight मॉडेल याच पद्धतीने platform वर परततील.
त्या कठीण कॉल्ससाठी जिथे तुम्ही premium मॉडेल उचलाल, त्याऐवजी Sangam consensus वापरून पाहा — एक panel समांतरपणे उत्तर देतो आणि एक synthesiser त्यांना एका उत्तरात एकत्र करतो. हे जास्त टोकन घेते, म्हणून ते फक्त त्याच कॉल्सवर लावा ज्या त्यास पात्र आहेत, नियमित 80% वर नाही. पाहा Sangam consensus रेसिपी.
अंदाज लावू नका — प्रति-मॉडेल वास्तविक खर्च वाचा आणि per-key ₹ budgets सेट करा जेणेकरून एखादे runaway job धक्का देणार नाही:
curl -s https://api.bharatrouter.com/me/activity \
-H "Authorization: Bearer br-..." | jq '.by_model'हे प्रति-मॉडेल सरासरी ₹/req आणि ₹/Mtok परत करते — पाहा Usage आणि अॅक्टिव्हिटी तसेच per-key budgets.
पुढे: OpenRouter च्या तुलनेत बचत सिद्ध करा, मग cheap-first chain जोडा.
आणखी रेसिपी कुकबुक मध्ये पाहा, किंवा संपूर्णAPI reference पाहा.