跳到內容
Cloud Speech 安裝

← 回到所有指南

設定指南

OpenAI 相容

不少服務都透過與 OpenAI /v1/audio/speech 端點相同的 API 提供語音模型, 而擴充功能可以連接其中任何一個。想在自己的機器上執行模型? 請見使用任何其他模型。使用託管服務不需要安裝任何東西: 建立帳戶、產生 API 金鑰, 再把服務的基底 URL 填給擴充功能即可, 費用按用量付給該服務。大約 5 分鐘就能完成。

您需要準備

  • 在一個提供 OpenAI 相容文字轉語音的服務上有帳戶
  • 大約 5 分鐘
  1. 1

    挑選服務

    已知以這種 API 形式提供文字轉語音的服務:

    • Groq
    • DeepInfra
    • Together AI: 單一端點就能使用多個模型家族, 包括 Cartesia Sonic、MiniMax Speech、Rime、Orpheus 與 Kokoro
  2. 2

    建立帳戶與 API 金鑰

    1. 在服務的網站上註冊, 若需要就先設定計費
    2. 在它的儀表板產生一把 API 金鑰並複製; 如果服務允許命名, 可以取名為 Cloud Speech extension 之類
    3. 在該服務的 API 文件中找到它的 OpenAI 相容基底 URL; 結尾通常是 /v1

    安全提醒

    請妥善保密金鑰; 任何人拿到它都能用您的帳戶消費。您隨時可以在同一個儀表板撤銷它。
  3. 3

    連接擴充功能

    1. 點選瀏覽器工具列上的擴充功能圖示
    2. 開啟設定 → OpenAI 相容
    3. 把服務的基底 URL 貼進伺服器 URL
    4. 貼上您的 API 金鑰 (託管服務都需要)
    5. 可視需要填寫以逗號分隔的語音名稱, 以及服務文件裡的模型 (預設是 tts-1)
    6. 點選儲存並測試

    擴充功能會先向服務詢問語音清單。如果服務沒有回報語音, 就會退回 OpenAI 的九個標準語音名稱, 而您在語音欄位填的內容優先。測試通過後, 在任何頁面上選取文字, 按右鍵選擇朗讀, 或按 Ctrl/Cmd+Shift+S

各服務的支援情況

可直接使用。LocalAI、Speaches 與 openedai-speech (見使用任何其他模型), 以及 Groq、DeepInfra、Together AI 等託管閘道。Together AI 可以直接取得 Cartesia 與 MiniMax 語音: 它的伺服器 URL 是 https://api.together.ai/v1, 其文件列出可貼進擴充功能語音與模型欄位的語音名稱和模型 ID (例如 hexgrad/Kokoro-82M)。

需要自行架設代理。ElevenLabs 與 Vertex AI/Gemini 使用自己的 API 格式; LiteLLM 代理可以把它們轉成這種端點形式, 如果您偏好代理勝過 Together AI, MiniMax 也可以這樣使用。LiteLLM 的架設方式見使用任何其他模型

費用

每個服務都有自己的費率; 開始前請先查看它的定價頁面: Groq 價格DeepInfra 價格, 或您所選服務的定價頁面。想知道託管服務和雲端服務商相比如何, 請見我們的服務商比較

不再使用時移除存取權

  1. 在服務的儀表板撤銷 API 金鑰。金鑰會立即失效。
  2. 在擴充功能中開啟設定 → OpenAI 相容, 清除已儲存的欄位 (或關閉這個服務商)。

疑難排解

401 或未授權錯誤

貼上的金鑰有誤或已被撤銷。請在服務的儀表板產生一把新金鑰, 貼進擴充功能的 API 金鑰欄位, 再點一次儲存並測試。金鑰前後多了空格也是常見原因。

404 或找不到資源錯誤

基底 URL 不對: 少了 /v1 結尾, 或指向錯誤的路徑。請完全按照服務 API 文件給的 OpenAI 相容基底 URL 複製, 然後重新儲存。

選擇器裡沒有語音, 或顯示錯誤的語音

擴充功能會先向服務詢問語音清單, 失敗時才退回 OpenAI 的標準名稱。如果服務的語音沒有出現, 請到它的文件查出語音名稱, 以逗號分隔填進語音欄位, 然後重新儲存。

沒有聲音、語音消失或鍵盤快速鍵的問題, 請見疑難排解指南

在找我們沒有列出的模型, 或免費的自架方案? 請改看使用任何其他模型。或者挑一家雲端服務商: Amazon PollyAzure SpeechGoogle Cloud TTSOpenAI