सेटअप गाइड
OpenAI-संगत
कई सेवाएँ अपने speech मॉडल OpenAI के /v1/audio/speech endpoint जैसे ही API से देती हैं, और एक्सटेंशन उनमें से किसी से भी बात कर सकता है। मॉडल अपनी मशीन पर चलाना चाहते हैं? देखें कोई भी दूसरा मॉडल इस्तेमाल करें। होस्टेड सेवा के लिए कुछ इंस्टॉल नहीं करना पड़ता: खाता बनाइए, API कुंजी बनाइए और एक्सटेंशन को सेवा का base URL दे दीजिए। भुगतान आप सेवा को उपयोग के हिसाब से करते हैं। इसमें लगभग 5 मिनट लगते हैं।
आपको क्या चाहिए
- ऐसी किसी सेवा का खाता जो OpenAI-संगत text-to-speech देती हो
- लगभग 5 मिनट
-
1
कोई सेवा चुनें
इस API आकार पर text-to-speech देने वाली जानी-पहचानी सेवाएँ:
- Groq
- DeepInfra
- Together AI: एक endpoint जिस पर कई मॉडल परिवार मिलते हैं, जिनमें Cartesia Sonic, MiniMax Speech, Rime, Orpheus और Kokoro शामिल हैं
-
2
खाता और API कुंजी बनाएँ
- सेवा की साइट पर साइन अप करें और ज़रूरी हो तो बिलिंग सेट करें
- उसके डैशबोर्ड में एक API कुंजी बनाकर कॉपी करें; सेवा नाम रखने दे तो Cloud Speech extension जैसा कुछ रखें
- सेवा के API दस्तावेज़ों में उसका OpenAI-संगत base URL ढूँढ़ें; यह आमतौर पर /v1 पर ख़त्म होता है
सुरक्षा चेतावनी
कुंजी गुप्त रखें; जिसके पास यह होगी, वह आपके खाते से ख़र्च कर सकता है। उसी डैशबोर्ड से आप इसे कभी भी रद्द कर सकते हैं। -
3
एक्सटेंशन जोड़ें
- ब्राउज़र टूलबार में एक्सटेंशन आइकन पर क्लिक करें
- सेटिंग्स → OpenAI-संगत खोलें
- सेवा का base URL Server URL के रूप में चिपकाएँ
- अपनी API कुंजी चिपकाएँ (होस्टेड सेवाओं में यह ज़रूरी है)
- चाहें तो अल्पविराम से अलग करके आवाज़ों के नाम और सेवा के दस्तावेज़ों से कोई मॉडल लिखें (डिफ़ॉल्ट tts-1 है)
- सहेजें और जाँचें पर क्लिक करें
एक्सटेंशन पहले सेवा से उसकी आवाज़ों की सूची माँगता है। सेवा आवाज़ें न बताए तो वह OpenAI के नौ मानक आवाज़-नामों पर लौट आता है, और आवाज़ों वाले फ़ील्ड में आपका लिखा हुआ सबसे ऊपर रहता है। जाँच पास होते ही किसी भी पेज पर टेक्स्ट हाइलाइट करें, राइट-क्लिक करके पढ़कर सुनाएँ चुनें, या Ctrl/Cmd+Shift+S दबाएँ।
कौन सी सेवा कहाँ खड़ी है
सीधे चलती हैं। LocalAI, Speaches और openedai-speech (जिनके बारे में कोई भी दूसरा मॉडल इस्तेमाल करें में बताया गया है), साथ ही Groq, DeepInfra और Together AI जैसे होस्टेड गेटवे। Together AI से Cartesia और MiniMax की आवाज़ें सीधे मिलती हैं: उसका Server URL https://api.together.ai/v1 है, और उसके दस्तावेज़ों में वे आवाज़-नाम और मॉडल id (जैसे hexgrad/Kokoro-82M) दिए हैं जिन्हें एक्सटेंशन के Voices और Models फ़ील्ड में चिपकाना है।
अपना चलाया हुआ proxy चाहिए। ElevenLabs और Vertex AI/Gemini अपने-अपने API स्वरूप इस्तेमाल करते हैं; LiteLLM proxy उन्हें इस endpoint आकार में बदल देता है, और Together AI के बजाय proxy पसंद हो तो MiniMax भी इसी तरह चलता है। LiteLLM चलाने का तरीक़ा कोई भी दूसरा मॉडल इस्तेमाल करें में है।
लागत
हर सेवा अपनी दरें ख़ुद तय करती है; शुरू करने से पहले उसका pricing पेज देख लें: Groq की क़ीमतें, DeepInfra की क़ीमतें, या आपने जो सेवा चुनी है उसका pricing पेज। होस्टेड सेवाओं की क्लाउड प्रदाताओं से तुलना के लिए हमारी प्रदाताओं की तुलना देखें।
काम पूरा होने पर एक्सेस हटाएँ
- सेवा के डैशबोर्ड में API कुंजी रद्द करें। वह उसी पल काम करना बंद कर देती है।
- एक्सटेंशन में सेटिंग्स → OpenAI-संगत खोलकर सहेजे हुए फ़ील्ड मिटा दें (या प्रदाता को बंद कर दें)।
समस्या निवारण
401 या unauthorized त्रुटियाँ
चिपकाई हुई कुंजी ग़लत है या रद्द हो चुकी है। सेवा के डैशबोर्ड में नई कुंजी बनाएँ, उसे एक्सटेंशन के API कुंजी फ़ील्ड में चिपकाएँ और सहेजें और जाँचें पर दोबारा क्लिक करें। कुंजी के आगे-पीछे का फालतू रिक्त स्थान भी एक आम कारण है।
404 या not-found त्रुटियाँ
Base URL ग़लत है: उसमें /v1 प्रत्यय छूटा हुआ है, या वह ग़लत path की ओर इशारा करता है। OpenAI-संगत base URL सेवा के API दस्तावेज़ों में जैसा दिया है ठीक वैसा ही कॉपी करके फिर से सहेजें।
पिकर में आवाज़ें नहीं हैं, या ग़लत आवाज़ें हैं
एक्सटेंशन पहले सेवा से उसकी आवाज़ों की सूची माँगता है और वह न मिले तो OpenAI के मानक नामों पर लौट आता है। सेवा की आवाज़ें न दिखें तो उनके नाम उसके दस्तावेज़ों में देखें, उन्हें अल्पविराम से अलग करके Voices फ़ील्ड में लिखें और फिर से सहेजें।
ऑडियो न बजने, आवाज़ों के गायब होने या कीबोर्ड शॉर्टकट की समस्याओं के लिए समस्या निवारण गाइड देखें।
हमारी सूची से बाहर का मॉडल चाहिए, या मुफ़्त self-hosted सेटअप? कोई भी दूसरा मॉडल इस्तेमाल करें देखें। या कोई क्लाउड प्रदाता चुनें: Amazon Polly, Azure Speech, Google Cloud TTS या OpenAI।