⚡ नया — Kimi K3 अब लाइव: अपनी Moonshot key जोड़ें →
दस्तावेज़

अपना inference बिल घटाएँ

← कुकबुक

tiered प्लेबुक: डिफ़ॉल्ट रूप से सबसे सस्ता India route, optimize:price, नियमित काम छोटे मॉडलों को सौंपें, cheap-first fallback, और quality खर्च उन्हीं कॉल पर जो उसके लायक हों।

optimize:price + delegation + BYOEलागतमध्यम12 min

ज़्यादातर टीमें हर request एक महंगे मॉडल को भेजकर ज़रूरत से ज़्यादा खर्च करती हैं — उन 80% कॉल समेत (classification, extraction, छोटे drafts, retries) जिन्हें एक सस्ता मॉडल उतनी ही अच्छी तरह संभालता है। यह वही tiered प्लेबुक है जिससे बिल कई गुना घटता है, बिना उन कॉल पर quality खोए जो मायने रखती हैं।

रणनीति — चार स्तर

  • बहुसंख्यक ट्रैफ़िक के लिए सबसे सस्ते route को डिफ़ॉल्ट बनाएँ।
  • optimize: "price" को सबसे सस्ता healthy route चुनने दें — अपने-आप।
  • नियमित sub-tasks किसी छोटे मॉडल को सौंपें; कठिन reasoning के लिए बड़ा मॉडल बचाकर रखें।
  • cheap-first fallback रखें ताकि महंगा मॉडल आख़िरी सहारा हो, डिफ़ॉल्ट नहीं।

अंगूठे का नियम: किसी request को premium मॉडल तभी चाहिए जब इंसान आउटपुट में फ़र्क़ पकड़ ले। ज़्यादातर में नहीं पकड़ता।

1 · सबसे सस्ते route को डिफ़ॉल्ट बनाएँ

BharatRouter पर gemma-4-e4b-it सबसे सस्ता India-resident chat route है — नियमित काम के लिए समझदार डिफ़ॉल्ट। अपने मौजूदा OpenAI code को दो लाइनें बदलकर इस पर लगाएँ:

from openai import OpenAI

client = OpenAI(base_url="https://api.bharatrouter.com/v1", api_key="br-...")

resp = client.chat.completions.create(
    model="gemma-4-e4b-it",
    messages=[{"role": "user", "content": "Classify this ticket: 'app won\u2019t open after update'"}],
)
print(resp.choices[0].message.content)

2 · optimize:price को सबसे सस्ता route चुनने दें

जब किसी मॉडल के एक से ज़्यादा route हों, optimize: "price" input + output ₹/Mtok के हिसाब से रैंक करके request सबसे सस्ते healthy route को भेजता है, किसी भी open-circuit route को छोड़कर। यह डिफ़ॉल्ट है, पर इसे स्पष्ट रखें — India-resident रहते हुए cheapest-first के लिए data_policy: "india_only" जोड़ें:

resp = client.chat.completions.create(
    model="gemma-4-e4b-it",
    messages=[{"role": "user", "content": "Summarise in two lines: ..."}],
    extra_body={"optimize": "price", "data_policy": "india_only"},
)

3 · नियमित काम छोटे मॉडल को सौंपें

सबसे बड़ी बचत sub-tasks के लिए महंगे मॉडल को बुलाने से आती है। एक छोटा मॉडल नियमित कदम करता है; सिर्फ़ सचमुच कठिन request बड़े मॉडल को जाती है। एक ही client से per-call मॉडल चुनें — model id बस एक string है:

def ask(model, prompt):
    return client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
        extra_body={"optimize": "price"},
    ).choices[0].message.content

# Routine: cheapest route
intent = ask("gemma-4-e4b-it", f"Intent of: {user_msg}? One word.")

# Hard reasoning only when it matters
if intent == "complex_support":
    answer = ask("gpt-5", build_prompt(user_msg))
else:
    answer = ask("gpt-5-mini", build_prompt(user_msg))

4 · cheap-first fallback, premium आख़िर में

विश्वसनीयता और लागत एक ही लीवर हैं अगर chain का क्रम सही हो: सबसे सस्ता route पहले, premium मॉडल सिर्फ़ आख़िरी सुरक्षा-जाल। विफलता पर router chain पर चलता है, इसलिए महंगा route तभी छुआ जाता है जब बाक़ी सब डाउन हों। इसे एक बार Collection के रूप में सहेजें ताकि सामान्य requests इसे इनहेरिट करें।

5 · अपना open-weight मॉडल ₹0 पर चलाएँ (BYOE)

सचमुच मुफ़्त tier चाहिए? अपना OpenAI-compatible deployment (vLLM, Ollama आदि) BYOE endpoint के रूप में register करें — यह ₹0 पर serve होता है और आपकी fallback chain के पहले कदम के रूप में जुड़ता है, पीछे paid routes सिर्फ़ backup के लिए। seller onboarding आने पर self-hosted open-weight मॉडल इसी तरह platform पर लौटेंगे।

6 · जब quality टोकन से बड़ी हो, Sangam इस्तेमाल करें

उन कठिन कॉल के लिए जहाँ आप premium मॉडल उठाते, बजाय उसके Sangam consensus आज़माएँ — एक panel समानांतर में जवाब देता है और एक synthesiser एक जवाब में मिलाता है। यह ज़्यादा टोकन लेता है, इसलिए इसे उन्हीं कॉल पर लगाएँ जो इसके लायक हों, नियमित 80% पर नहीं। देखें Sangam consensus रेसिपी

7 · जो वाकई खर्च हुआ उसे मापें

अंदाज़ा न लगाएँ — प्रति-मॉडल वास्तविक लागत पढ़ें और per-key ₹ budgets सेट करें ताकि कोई runaway job चौंका न दे:

curl -s https://api.bharatrouter.com/me/activity \
  -H "Authorization: Bearer br-..." | jq '.by_model'

यह प्रति-मॉडल औसत ₹/req और ₹/Mtok लौटाता है — देखें Usage और गतिविधि तथा per-key budgets

अगला: OpenRouter बनाम बचत साबित करें, फिर cheap-first chain जोड़ें

और रेसिपी कुकबुक में, या पूराAPI reference देखें।