⚡ नवीन — Kimi K3 आता लाइव: तुमची Moonshot की जोडा →
दस्तऐवज

तुमचे inference बिल कमी करा

← कुकबुक

tiered प्लेबुक: डीफॉल्टनुसार सर्वात स्वस्त India route, optimize:price, नियमित काम छोट्या मॉडेल्सना सोपवा, cheap-first fallback, आणि quality खर्च फक्त त्याच कॉल्सवर जे त्यास पात्र आहेत.

optimize:price + delegation + BYOEखर्चमध्यम12 min

बहुतांश टीम प्रत्येक request एका महागड्या मॉडेलकडे पाठवून गरजेपेक्षा जास्त खर्च करतात — त्या 80% कॉल्ससह (classification, extraction, छोटे drafts, retries) ज्या एखादे स्वस्त मॉडेल तितक्याच चांगल्या प्रकारे हाताळते. हीच ती tiered प्लेबुक आहे जिच्यामुळे बिल कितीतरी पटीने कमी होते, मात्र महत्त्वाच्या कॉल्सवरील quality न गमावता.

रणनीती — चार स्तर

  • बहुसंख्य ट्रॅफिकसाठी सर्वात स्वस्त route ला डीफॉल्ट बनवा.
  • optimize: "price" ला सर्वात स्वस्त healthy route निवडू द्या — आपोआप.
  • नियमित sub-tasks एखाद्या छोट्या मॉडेलला सोपवा; कठीण reasoning साठी मोठे मॉडेल राखून ठेवा.
  • cheap-first fallback ठेवा जेणेकरून महाग मॉडेल हा शेवटचा आधार असेल, डीफॉल्ट नाही.

अंगठ्याचा नियम: एखाद्या request ला premium मॉडेल तेव्हाच हवे जेव्हा माणूस आउटपुटमधला फरक ओळखेल. बहुतांश वेळी ओळखत नाही.

1 · सर्वात स्वस्त route ला डीफॉल्ट बनवा

BharatRouter वर gemma-4-e4b-it हा सर्वात स्वस्त India-resident chat route आहे — नियमित कामासाठी एक समजूतदार डीफॉल्ट. तुमचा सध्याचा OpenAI code दोन ओळी बदलून यावर लावा:

from openai import OpenAI

client = OpenAI(base_url="https://api.bharatrouter.com/v1", api_key="br-...")

resp = client.chat.completions.create(
    model="gemma-4-e4b-it",
    messages=[{"role": "user", "content": "Classify this ticket: 'app won\u2019t open after update'"}],
)
print(resp.choices[0].message.content)

2 · optimize:price ला सर्वात स्वस्त route निवडू द्या

जेव्हा एखाद्या मॉडेलचे एकाहून अधिक route असतील, तेव्हा optimize: "price" input + output ₹/Mtok नुसार रँक करून request सर्वात स्वस्त healthy route कडे पाठवते, कोणताही open-circuit route वगळून. हे डीफॉल्ट आहे, पण ते स्पष्ट ठेवा — India-resident राहूनच cheapest-first साठी data_policy: "india_only" जोडा:

resp = client.chat.completions.create(
    model="gemma-4-e4b-it",
    messages=[{"role": "user", "content": "Summarise in two lines: ..."}],
    extra_body={"optimize": "price", "data_policy": "india_only"},
)

3 · नियमित काम छोट्या मॉडेलला सोपवा

सर्वात मोठी बचत sub-tasks साठी महागड्या मॉडेलला बोलावल्याने होते. एक छोटे मॉडेल नियमित पायऱ्या करते; फक्त खरोखर कठीण request मोठ्या मॉडेलकडे जाते. एकाच client मधून per-call मॉडेल निवडा — model id हे फक्त एक string आहे:

def ask(model, prompt):
    return client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
        extra_body={"optimize": "price"},
    ).choices[0].message.content

# Routine: cheapest route
intent = ask("gemma-4-e4b-it", f"Intent of: {user_msg}? One word.")

# Hard reasoning only when it matters
if intent == "complex_support":
    answer = ask("gpt-5", build_prompt(user_msg))
else:
    answer = ask("gpt-5-mini", build_prompt(user_msg))

4 · cheap-first fallback, premium शेवटी

विश्वासार्हता आणि खर्च हे एकच लीव्हर आहेत जर chain चा क्रम बरोबर असेल: सर्वात स्वस्त route आधी, premium मॉडेल फक्त शेवटचे सुरक्षा-जाल. अपयशावर router chain वर चालतो, त्यामुळे महाग route तेव्हाच स्पर्शला जातो जेव्हा बाकी सर्व डाउन असतात. हे एकदा Collection म्हणून जतन करा जेणेकरून सामान्य requests ते इनहेरिट करतील.

5 · तुमचे open-weight मॉडेल ₹0 वर चालवा (BYOE)

खरोखर मोफत tier हवा आहे? तुमचे OpenAI-compatible deployment (vLLM, Ollama इत्यादी) BYOE endpoint म्हणून register करा — ते ₹0 वर serve होते आणि तुमच्या fallback chain च्या पहिल्या पायरी म्हणून जोडले जाते, मागे paid routes फक्त backup साठी. seller onboarding आल्यावर self-hosted open-weight मॉडेल याच पद्धतीने platform वर परततील.

6 · जेव्हा quality टोकनपेक्षा मोठी असेल, तेव्हा Sangam वापरा

त्या कठीण कॉल्ससाठी जिथे तुम्ही premium मॉडेल उचलाल, त्याऐवजी Sangam consensus वापरून पाहा — एक panel समांतरपणे उत्तर देतो आणि एक synthesiser त्यांना एका उत्तरात एकत्र करतो. हे जास्त टोकन घेते, म्हणून ते फक्त त्याच कॉल्सवर लावा ज्या त्यास पात्र आहेत, नियमित 80% वर नाही. पाहा Sangam consensus रेसिपी.

7 · खरोखर जे खर्च झाले ते मोजा

अंदाज लावू नका — प्रति-मॉडेल वास्तविक खर्च वाचा आणि per-key ₹ budgets सेट करा जेणेकरून एखादे runaway job धक्का देणार नाही:

curl -s https://api.bharatrouter.com/me/activity \
  -H "Authorization: Bearer br-..." | jq '.by_model'

हे प्रति-मॉडेल सरासरी ₹/req आणि ₹/Mtok परत करते — पाहा Usage आणि अ‍ॅक्टिव्हिटी तसेच per-key budgets.

पुढे: OpenRouter च्या तुलनेत बचत सिद्ध करा, मग cheap-first chain जोडा.

आणखी रेसिपी कुकबुक मध्ये पाहा, किंवा संपूर्णAPI reference पाहा.