Esc to close · ⌘K / Ctrl-K opens search anywhere
tiered प्लेबुक: डिफ़ॉल्ट रूप से सबसे सस्ता India route, optimize:price, नियमित काम छोटे मॉडलों को सौंपें, cheap-first fallback, और quality खर्च उन्हीं कॉल पर जो उसके लायक हों।
optimize:price + delegation + BYOEलागतमध्यम12 min
ज़्यादातर टीमें हर request एक महंगे मॉडल को भेजकर ज़रूरत से ज़्यादा खर्च करती हैं — उन 80% कॉल समेत (classification, extraction, छोटे drafts, retries) जिन्हें एक सस्ता मॉडल उतनी ही अच्छी तरह संभालता है। यह वही tiered प्लेबुक है जिससे बिल कई गुना घटता है, बिना उन कॉल पर quality खोए जो मायने रखती हैं।
optimize: "price" को सबसे सस्ता healthy route चुनने दें — अपने-आप।अंगूठे का नियम: किसी request को premium मॉडल तभी चाहिए जब इंसान आउटपुट में फ़र्क़ पकड़ ले। ज़्यादातर में नहीं पकड़ता।
BharatRouter पर gemma-4-e4b-it सबसे सस्ता India-resident chat route है — नियमित काम के लिए समझदार डिफ़ॉल्ट। अपने मौजूदा OpenAI code को दो लाइनें बदलकर इस पर लगाएँ:
from openai import OpenAI
client = OpenAI(base_url="https://api.bharatrouter.com/v1", api_key="br-...")
resp = client.chat.completions.create(
model="gemma-4-e4b-it",
messages=[{"role": "user", "content": "Classify this ticket: 'app won\u2019t open after update'"}],
)
print(resp.choices[0].message.content)जब किसी मॉडल के एक से ज़्यादा route हों, optimize: "price" input + output ₹/Mtok के हिसाब से रैंक करके request सबसे सस्ते healthy route को भेजता है, किसी भी open-circuit route को छोड़कर। यह डिफ़ॉल्ट है, पर इसे स्पष्ट रखें — India-resident रहते हुए cheapest-first के लिए data_policy: "india_only" जोड़ें:
resp = client.chat.completions.create(
model="gemma-4-e4b-it",
messages=[{"role": "user", "content": "Summarise in two lines: ..."}],
extra_body={"optimize": "price", "data_policy": "india_only"},
)सबसे बड़ी बचत sub-tasks के लिए महंगे मॉडल को न बुलाने से आती है। एक छोटा मॉडल नियमित कदम करता है; सिर्फ़ सचमुच कठिन request बड़े मॉडल को जाती है। एक ही client से per-call मॉडल चुनें — model id बस एक string है:
def ask(model, prompt):
return client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
extra_body={"optimize": "price"},
).choices[0].message.content
# Routine: cheapest route
intent = ask("gemma-4-e4b-it", f"Intent of: {user_msg}? One word.")
# Hard reasoning only when it matters
if intent == "complex_support":
answer = ask("gpt-5", build_prompt(user_msg))
else:
answer = ask("gpt-5-mini", build_prompt(user_msg))विश्वसनीयता और लागत एक ही लीवर हैं अगर chain का क्रम सही हो: सबसे सस्ता route पहले, premium मॉडल सिर्फ़ आख़िरी सुरक्षा-जाल। विफलता पर router chain पर चलता है, इसलिए महंगा route तभी छुआ जाता है जब बाक़ी सब डाउन हों। इसे एक बार Collection के रूप में सहेजें ताकि सामान्य requests इसे इनहेरिट करें।
सचमुच मुफ़्त tier चाहिए? अपना OpenAI-compatible deployment (vLLM, Ollama आदि) BYOE endpoint के रूप में register करें — यह ₹0 पर serve होता है और आपकी fallback chain के पहले कदम के रूप में जुड़ता है, पीछे paid routes सिर्फ़ backup के लिए। seller onboarding आने पर self-hosted open-weight मॉडल इसी तरह platform पर लौटेंगे।
उन कठिन कॉल के लिए जहाँ आप premium मॉडल उठाते, बजाय उसके Sangam consensus आज़माएँ — एक panel समानांतर में जवाब देता है और एक synthesiser एक जवाब में मिलाता है। यह ज़्यादा टोकन लेता है, इसलिए इसे उन्हीं कॉल पर लगाएँ जो इसके लायक हों, नियमित 80% पर नहीं। देखें Sangam consensus रेसिपी।
अंदाज़ा न लगाएँ — प्रति-मॉडल वास्तविक लागत पढ़ें और per-key ₹ budgets सेट करें ताकि कोई runaway job चौंका न दे:
curl -s https://api.bharatrouter.com/me/activity \
-H "Authorization: Bearer br-..." | jq '.by_model'यह प्रति-मॉडल औसत ₹/req और ₹/Mtok लौटाता है — देखें Usage और गतिविधि तथा per-key budgets।
अगला: OpenRouter बनाम बचत साबित करें, फिर cheap-first chain जोड़ें।
और रेसिपी कुकबुक में, या पूराAPI reference देखें।