सीधे सामग्री पर जाएँ
Cloud Speech इंस्टॉल करें

← सभी गाइड पर वापस

सेटअप गाइड

कोई भी दूसरा मॉडल इस्तेमाल करें

यह पेज उन मॉडलों के लिए है जो एक्सटेंशन की सूची में सीधे नहीं हैं। उन तक पहुँचने के दो रास्ते हैं: LiteLLM proxy उन प्रदाताओं के आगे एक OpenAI-संगत endpoint लगा देता है जिनकी कुंजियाँ आपके पास पहले से हैं (ElevenLabs, MiniMax, Vertex AI/Gemini और अन्य); proxy के अलावा कुछ होस्ट नहीं करना पड़ता। या फिर कोई ओपन मॉडल अपनी ही मशीन पर होस्ट करें, जहाँ कुछ भी आपके कंप्यूटर से बाहर नहीं जाता और प्रति-अक्षर कोई शुल्क नहीं लगता। टर्मिनल की आदत हो तो दोनों में लगभग 10 मिनट लगते हैं।

आपको क्या चाहिए

  • proxy वाले रास्ते के लिए: जिस प्रदाता तक जाना है उसकी API कुंजी (बिल उसी की दरों पर बनता है)
  • self-hosting के लिए: ऐसा कंप्यूटर जो इंजन चला सके (कुछ मॉडल GPU माँगते हैं, छोटे नहीं माँगते)
  • एक टर्मिनल, और रास्ते के हिसाब से Python या Docker
  • लगभग 10 मिनट

रास्ता 1: LiteLLM proxy लगाएँ

LiteLLM proxy आपको उन प्रदाताओं के आगे एक OpenAI-संगत endpoint देता है जिनकी कुंजियाँ आपके पास पहले से हैं: OpenAI, Azure, AWS Polly, Vertex AI/Gemini, ElevenLabs या MiniMax। आप proxy होस्ट करते हैं, मॉडल नहीं, इसलिए यह किसी भी मशीन पर आराम से चलता है।

1. इंस्टॉल करें

Python 3.10 या नया चाहिए। फिर:

pip install 'litellm[proxy]'

2. एक backend के साथ जल्दी शुरुआत

backend की कुंजी export करें और जिस मॉडल तक जाना है उसके साथ proxy शुरू करें। यह पोर्ट 4000 पर सुनता है:

export OPENAI_API_KEY=sk-...
litellm --model openai/tts-1
# RUNNING on http://0.0.0.0:4000

3. या कई प्रदाताओं तक रास्ता बनाएँ

हर backend को एक config.yaml में लिखें। यहाँ चुने हुए model_name उपनाम ही एक्सटेंशन के Models फ़ील्ड में लिखे जाएँगे:

model_list:
  - model_name: tts
    litellm_params:
      model: openai/tts-1
      api_key: os.environ/OPENAI_API_KEY
  - model_name: eleven
    litellm_params:
      model: elevenlabs/eleven_multilingual_v2
      api_key: os.environ/ELEVENLABS_API_KEY

# optional: require a key from clients (paste it into the
# extension's API key field)
general_settings:
  master_key: sk-your-proxy-key
litellm --config config.yaml

MiniMax, Vertex AI/Gemini, Azure और Polly की प्रविष्टियाँ इसी ढर्रे पर बनती हैं; सटीक मॉडल strings LiteLLM के TTS दस्तावेज़ों और उसके प्रति-प्रदाता पेजों में हैं।

4. एक्सटेंशन को इसकी ओर मोड़ें

Server URL http://localhost:4000/v1; API कुंजी तभी जब आपने master key रखी हो; Models फ़ील्ड tts, eleven (आपके उपनाम)। आवाज़ों के लिए alloy जैसे OpenAI नाम हर जगह चलते हैं, और LiteLLM उन्हें हर backend के हिसाब से बदल देता है (ElevenLabs के लिए कच्ची voice ID भी बिना बदले आगे चली जाती हैं)।

रास्ता 2: कोई ओपन मॉडल होस्ट करें (वैकल्पिक)

proxy वाला रास्ता आपके लिए काफ़ी है तो इसे छोड़ दें। इंजन ख़ुद होस्ट करने से हर अनुरोध आपकी मशीन पर ही रहता है और प्रति अक्षर कुछ नहीं लगता। आम विकल्प:

  • LocalAI: OpenAI का पूरा लोकल विकल्प, जो Kokoro, Piper और Coqui जैसे कई TTS backend लोड करता है
  • Speaches: हल्का सर्वर जो Kokoro और Piper की आवाज़ें एक ही endpoint पर चलाता है
  • Kokoro-FastAPI: सिर्फ़ Kokoro मॉडल चाहिए हो तो सबसे तेज़ शुरुआत
  • openedai-speech: छोटा सर्वर जो इसी API पर ओपन TTS मॉडल चलाता है

Kokoro-FastAPI के लिए एक Docker कमांड पोर्ट 8880 पर सर्वर शुरू कर देती है:

docker run -d --name kokoro -p 8880:8880 ghcr.io/remsky/kokoro-fastapi-cpu

बाक़ी इंजनों के इंस्टॉल उनके अपने दस्तावेज़ों में हैं: LocalAI या Speaches के getting-started पेज देखें। ज़्यादातर Docker कंटेनर या Python पैकेज के रूप में चलते हैं और किसी लोकल पोर्ट पर सुनते हैं।

एक्सटेंशन जोड़ें

  1. ब्राउज़र टूलबार में एक्सटेंशन आइकन पर क्लिक करें
  2. सेटिंग्स → OpenAI-संगत खोलें
  3. Server URL चिपकाएँ: LiteLLM के लिए http://localhost:4000/v1, Kokoro-FastAPI के लिए http://localhost:8880/v1, या आपके इंजन का अपना पोर्ट
  4. API कुंजी तभी लिखें जब सर्वर माँगे (लोकल सर्वर आमतौर पर नहीं माँगते)
  5. चाहें तो अल्पविराम से अलग करके आवाज़ों के नाम लिखें, और एक या ज़्यादा मॉडल भी, वे भी अल्पविराम से अलग (डिफ़ॉल्ट tts-1 है, जिसे ज़्यादातर सर्वर मान लेते हैं)
  6. सहेजें और जाँचें पर क्लिक करें

एक्सटेंशन पहले सर्वर से उसकी आवाज़ों की सूची माँगता है, इसलिए आवाज़ों वाला फ़ील्ड आमतौर पर खाली छोड़ा जा सकता है। सर्वर आवाज़ें न बताए तो वह OpenAI के नौ मानक आवाज़-नामों पर लौट आता है, और फ़ील्ड में आपका लिखा हुआ सबसे ऊपर रहता है। आपका लिखा हर मॉडल वॉइस पिकर में हर आवाज़ के लिए अपनी अलग पंक्ति बनता है, इसलिए एक सर्वर एक साथ कई मॉडल दे सकता है और आप हर पाठ के लिए उनमें से चुन सकते हैं। जाँच पास होते ही किसी भी पेज पर टेक्स्ट हाइलाइट करें, राइट-क्लिक करके पढ़कर सुनाएँ चुनें, या Ctrl/Cmd+Shift+S दबाएँ।

लागत

दोनों रास्तों के बिल अलग-अलग बनते हैं। LiteLLM proxy से हर अनुरोध का बिल उसी backend की दरों पर बनता है जिस तक वह जाता है, और आपका टेक्स्ट उसी प्रदाता तक पहुँचता है; LiteLLM ख़ुद मुफ़्त सॉफ़्टवेयर है। self-hosted इंजन हार्डवेयर होने के बाद मुफ़्त चलता है, न प्रति-अक्षर शुल्क, न मशीन से बाहर जाता कुछ। प्रदाताओं की दरों के लिए हमारी प्रदाताओं की तुलना देखें।

काम पूरा होने पर एक्सेस हटाएँ

  1. सर्वर प्रक्रिया रोक दें (Ctrl+C) या उसका कंटेनर हटा दें।
  2. एक्सटेंशन में सेटिंग्स → OpenAI-संगत खोलकर सहेजे हुए फ़ील्ड मिटा दें (या प्रदाता को बंद कर दें)।

समस्या निवारण

Connection refused या नेटवर्क त्रुटियाँ

सहेजे हुए URL पर सर्वर पहुँच में नहीं है। जाँचें कि वह सचमुच चल रहा है, URL का पोर्ट वही है जिस पर सर्वर सुनता है, और URL /v1 पर ख़त्म होता है। फिर सहेजें और जाँचें पर दोबारा क्लिक करें।

401 या unauthorized त्रुटियाँ

सर्वर API कुंजी माँग रहा है। उसे एक्सटेंशन के API कुंजी फ़ील्ड में चिपकाएँ; प्रमाणीकरण चालू किए LiteLLM proxy के लिए यह proxy की master या virtual कुंजी है, backend प्रदाता की कुंजी नहीं।

पिकर में आवाज़ें नहीं हैं, या ग़लत आवाज़ें हैं

एक्सटेंशन पहले सर्वर से उसकी आवाज़ों की सूची माँगता है और वह न मिले तो OpenAI के मानक नामों पर लौट आता है। आपके सर्वर की आवाज़ें न दिखें तो उनके नाम ख़ुद Voices फ़ील्ड में अल्पविराम से अलग करके लिखें और फिर से सहेजें।

ऑडियो न बजने, आवाज़ों के गायब होने या कीबोर्ड शॉर्टकट की समस्याओं के लिए समस्या निवारण गाइड देखें।

यह सब सेटअप नहीं करना चाहते? होस्टेड सेवा एक्सटेंशन की इन्हीं सेटिंग्स के साथ चलती है; देखें OpenAI-संगत। या कोई क्लाउड प्रदाता चुनें: Amazon Polly, Azure Speech, Google Cloud TTS या OpenAI