प्रदाताओं की क़ीमतों की तुलना
एक्सटेंशन व्यक्तियों के लिए मुफ़्त है। आप सिर्फ़ अपने चुने हुए क्लाउड प्रदाता को उन अक्षरों का भुगतान करते हैं जिन्हें आप आवाज़ में बदलते हैं (हर अक्षर गिना जाता है, रिक्त स्थान भी)। नीचे चारों क्लाउड प्रदाताओं की तुलना है, साथ में लोकल या proxy सर्वरों के लिए OpenAI-संगत विकल्प भी। क़ीमतें अनुमानित हैं, USD में हैं और समय के साथ बदलती रहती हैं; हमेशा नीचे दिए आधिकारिक pricing पेजों पर पुष्टि करें।
मुफ़्त टियर: 5M standard + 1M neural अक्षर/माह, सिर्फ़ पहले 12 महीने
प्रति 1M अक्षर लागत
- Standard: $4
- Neural: $16
- Generative: $30
- Long-form: $100
मुफ़्त टियर: Free (F0) टियर पर 0.5M neural अक्षर/माह; हर महीने फिर से मिलता है
प्रति 1M अक्षर लागत
- Neural: ~$15-16
- HD / कस्टम आवाज़ें: इससे ज़्यादा
मुफ़्त टियर: 4M standard + 1M WaveNet अक्षर/माह; हर महीने फिर से मिलता है (Studio-श्रेणी की आवाज़ों का अलग मुफ़्त कोटा काफ़ी छोटा है)
प्रति 1M अक्षर लागत
- Standard: ~$4
- WaveNet / Neural2: ~$16
- Chirp HD: इससे ज़्यादा
- Chirp 3 HD / Gemini-TTS: ~$30
- Studio: ~$160
मुफ़्त टियर: कोई मुफ़्त टियर नहीं; जितना इस्तेमाल, उतना भुगतान
प्रति 1M अक्षर लागत
- tts-1: ~$15
- tts-1-hd: ~$30
- gpt-4o-mini-tts: token के हिसाब से बिल; ~$12/1M ऑडियो token (व्यवहार में लगभग tts-1 जितना)
मुफ़्त टियर: लोकल इंजन चलाना मुफ़्त है; गेटवे अपने बैकएंड के हिसाब से बिल करते हैं
प्रति 1M अक्षर लागत
- लोकल (LocalAI, Speaches): मुफ़्त
- गेटवे के ज़रिए (LiteLLM, Groq): बैकएंड की दरें
व्यवहार में इसका मतलब क्या है?
दस लाख (1M) अक्षर लगभग 10-15 घंटे सुनने के बराबर हैं, यानी क़रीब दो औसत उपन्यास। $4 प्रति दस लाख (standard आवाज़ें) की दर पर 1,500 शब्दों का एक आम लेख पढ़वाने का ख़र्च क़रीब एक सेंट का 4 सौवाँ हिस्सा है; $16 प्रति दस लाख (neural) पर क़रीब एक सेंट का छठा हिस्सा। रोज़ का हल्का-फुल्का इस्तेमाल आमतौर पर Azure या Google के मासिक मुफ़्त टियर के भीतर ही रह जाता है।
लागत घटाने के सुझाव
- ज़्यादातर सामग्री के लिए standard आवाज़ें इस्तेमाल करें। इनकी लागत neural आवाज़ों की चौथाई है और लेख सरसरी तौर पर सुनने के लिए ये काफ़ी हैं।
- Neural आवाज़ें अहम ऑडियो के लिए बचाकर रखें: लंबे लेख, ऐसे डाउनलोड जो आप रखने वाले हैं, या जो सामग्री आप ध्यान से सुनते हैं।
- Generative, HD और long-form आवाज़ें कम ही इस्तेमाल करें। इनकी लागत standard आवाज़ों से 2-25x ज़्यादा है।
- हर महीने मिलने वाले मुफ़्त टियर का फ़ायदा उठाएँ। Azure (0.5M neural) और Google (1M WaveNet + 4M standard) के कोटे हर महीने रीसेट होते हैं। कई प्रदाता मिलाकर चलाएँ तो हल्का-फुल्का इस्तेमाल हमेशा मुफ़्त रह सकता है।
- अपने प्रदाता के कंसोल में उपयोग पर नज़र रखें (AWS Console → Polly उपयोग रिपोर्ट, Azure Portal के मेट्रिक्स, Google Cloud की बिलिंग रिपोर्ट, OpenAI का उपयोग डैशबोर्ड)।
- बिलिंग अलर्ट सेट करें ताकि ख़र्च बढ़ने से पहले आपको सूचना मिल जाए। हर प्रदाता बजट या ख़र्च के अलर्ट देता है।
प्रदाता जोड़ने के लिए तैयार हैं? किसी सेटअप गाइड से शुरू करें: Amazon Polly, Azure Speech, Google Cloud TTS, OpenAI या कोई OpenAI-संगत सर्वर।