跳到內容
Cloud Speech 安裝

← 回到所有指南

設定指南

使用任何其他模型

本頁介紹如何使用擴充功能沒有直接列出的模型。有兩條路: LiteLLM 代理會在您已持有金鑰的服務商 (ElevenLabs、MiniMax、Vertex AI/Gemini 等) 前面架起一個 OpenAI 相容端點, 除了代理本身之外什麼都不用架設。或者在自己的機器上執行開放模型, 資料完全不出您的電腦, 也沒有按字元計費。只要您會用終端機, 兩條路都是 10 分鐘左右的事。

您需要準備

  • 走代理路線: 目標服務商的 API 金鑰 (按該服務商的費率計費)
  • 走自架路線: 一台能跑引擎的電腦 (有些模型需要 GPU, 較小的模型不用)
  • 一個終端機, 以及依路線而定的 Python 或 Docker
  • 大約 10 分鐘

路線一: 架設 LiteLLM 代理

LiteLLM 代理會在您已持有金鑰的服務商前面提供單一的 OpenAI 相容端點: OpenAI、Azure、AWS Polly、Vertex AI/Gemini、ElevenLabs 或 MiniMax。您架的是代理而不是模型本身, 所以任何機器都跑得動。

1. 安裝

需要 Python 3.10 或更新版本。接著:

pip install 'litellm[proxy]'

2. 快速上手: 單一後端

匯出後端的金鑰, 帶著您要轉送的模型啟動代理。它會在 4000 埠監聽:

export OPENAI_API_KEY=sk-...
litellm --model openai/tts-1
# RUNNING on http://0.0.0.0:4000

3. 或轉送到多家服務商

把每個後端寫進 config.yaml。您在這裡取的 model_name 別名, 就是之後要填進擴充功能模型欄位的名稱:

model_list:
  - model_name: tts
    litellm_params:
      model: openai/tts-1
      api_key: os.environ/OPENAI_API_KEY
  - model_name: eleven
    litellm_params:
      model: elevenlabs/eleven_multilingual_v2
      api_key: os.environ/ELEVENLABS_API_KEY

# optional: require a key from clients (paste it into the
# extension's API key field)
general_settings:
  master_key: sk-your-proxy-key
litellm --config config.yaml

MiniMax、Vertex AI/Gemini、Azure 與 Polly 的設定寫法相同; 確切的模型字串請見 LiteLLM TTS 文件及其各服務商頁面。

4. 把擴充功能指向代理

伺服器 URL 填 http://localhost:4000/v1; 只有設定了 master key 才需要填 API 金鑰; 模型欄位填 tts, eleven (您取的別名)。語音方面, alloy 等 OpenAI 名稱在各後端都能用, 由 LiteLLM 逐一對應 (ElevenLabs 的原始語音 ID 也會原樣傳遞)。

路線二: 自行執行開放模型 (選用)

如果代理路線已經夠用, 可以跳過這一段。自己架引擎能讓每個請求都留在您的機器上, 而且沒有按字元計費。常見選擇:

  • LocalAI: 完整的本機 OpenAI 替代方案, 可載入 Kokoro、Piper、Coqui 等多種 TTS 後端
  • Speaches: 較輕量的伺服器, 用單一端點提供 Kokoro 與 Piper 語音
  • Kokoro-FastAPI: 如果您只需要 Kokoro 模型, 這是最快的起點
  • openedai-speech: 以這種 API 提供開放 TTS 模型的小型伺服器

以 Kokoro-FastAPI 為例, 一條 Docker 指令就能在 8880 埠啟動伺服器:

docker run -d --name kokoro -p 8880:8880 ghcr.io/remsky/kokoro-fastapi-cpu

其他引擎的安裝方式請見各自的文件: LocalAISpeaches 的入門頁面。多數引擎以 Docker 容器或 Python 套件執行, 並在本機的某個埠監聽。

連接擴充功能

  1. 點選瀏覽器工具列上的擴充功能圖示
  2. 開啟設定 → OpenAI 相容
  3. 貼上伺服器 URL: LiteLLM 是 http://localhost:4000/v1, Kokoro-FastAPI 是 http://localhost:8880/v1, 或您的引擎自己的埠
  4. 只有在伺服器要求時才需要填 API 金鑰 (本機伺服器通常不用)
  5. 可視需要填寫以逗號分隔的語音名稱, 以及一個或多個同樣以逗號分隔的模型 (預設是 tts-1, 多數伺服器都接受)
  6. 點選儲存並測試

擴充功能會先向伺服器詢問語音清單, 所以語音欄位通常可以留白。如果伺服器沒有回報語音, 就會退回 OpenAI 的九個標準語音名稱, 而您在欄位裡填的內容優先。您列出的每個模型, 在語音選擇器中都會為每個語音各佔一列, 因此一台伺服器可以同時提供多個模型, 每次朗讀都能切換。測試通過後, 在任何頁面上選取文字, 按右鍵選擇朗讀, 或按 Ctrl/Cmd+Shift+S

費用

兩條路線的計費方式不同。透過 LiteLLM 代理, 每個請求由它轉送到的後端按該服務商自己的費率計費, 您的文字也會傳送給該服務商; LiteLLM 本身是免費軟體。自架引擎只要有硬體就能免費執行, 沒有按字元計費, 資料也不會離開您的機器。各服務商的費率請見我們的服務商比較

不再使用時移除存取權

  1. 停止伺服器程序 (Ctrl+C) 或刪除它的容器。
  2. 在擴充功能中開啟設定 → OpenAI 相容, 清除已儲存的欄位 (或關閉這個服務商)。

疑難排解

連線被拒或網路錯誤

伺服器在您儲存的 URL 上連不到。請確認它真的在執行、URL 裡的埠和伺服器監聽的埠一致, 且 URL 以 /v1 結尾。然後再點一次儲存並測試

401 或未授權錯誤

伺服器要求 API 金鑰。請把它貼進擴充功能的 API 金鑰欄位; 若是啟用了驗證的 LiteLLM 代理, 要填的是代理的 master key 或虛擬金鑰, 而不是後端服務商的金鑰。

選擇器裡沒有語音, 或顯示錯誤的語音

擴充功能會先向伺服器詢問語音清單, 失敗時才退回 OpenAI 的標準名稱。如果您伺服器的語音沒有出現, 請自己把語音名稱以逗號分隔填進語音欄位, 然後重新儲存。

沒有聲音、語音消失或鍵盤快速鍵的問題, 請見疑難排解指南

想省下架設的功夫? 託管服務用的是同一組擴充功能設定; 請見OpenAI 相容。或者挑一家雲端服務商: Amazon PollyAzure SpeechGoogle Cloud TTSOpenAI