跳到内容
Cloud Speech 安装

← 返回全部指南

设置指南

OpenAI 兼容

不少服务通过与 OpenAI 的 /v1/audio/speech 端点相同的 API 提供语音模型, 扩展可以直接与它们通信。想在自己的电脑上运行模型? 参见使用任何其他模型。托管服务则无需安装任何东西: 注册账号、生成 API 密钥, 再把服务的基础 URL 填给扩展即可。费用按使用量支付给该服务。大约 5 分钟即可完成。

您需要准备

  • 在一家提供 OpenAI 兼容文字转语音的服务上注册的账号
  • 大约 5 分钟
  1. 1

    选择服务

    已知按这种 API 形式提供文字转语音的服务:

    • Groq
    • DeepInfra
    • Together AI: 一个端点即可使用多个模型家族, 包括 Cartesia Sonic、MiniMax Speech、Rime、Orpheus 和 Kokoro
  2. 2

    创建账号和 API 密钥

    1. 在服务的网站上注册; 若有要求, 先设置结算
    2. 在其控制台生成一个 API 密钥并复制; 如果服务支持命名, 可叫 Cloud Speech extension 之类
    3. 在其 API 文档中找到该服务的 OpenAI 兼容基础 URL, 通常以 /v1 结尾

    安全警告

    请妥善保管密钥; 拿到它的人都能消耗您的账户余额。您随时可以在同一控制台撤销它。
  3. 3

    连接扩展

    1. 点击浏览器工具栏中的扩展图标
    2. 打开设置 → OpenAI 兼容
    3. 把服务的基础 URL 粘贴为服务器 URL
    4. 粘贴您的 API 密钥 (托管服务都需要)
    5. 可选: 填写用逗号分隔的语音名称, 以及服务文档中给出的 模型 (默认为 tts-1)
    6. 点击保存并测试

    扩展会先向服务请求它的语音列表。如果服务不报告语音, 就回退到 OpenAI 的九个标准语音名称, 而您在语音栏中输入的内容优先级最高。测试通过后, 在任意页面上选中文字, 点击右键选择朗读, 或按 Ctrl/Cmd+Shift+S

各项服务的支持情况

可直接使用。LocalAI、Speaches 和 openedai-speech (见使用任何其他模型), 以及 Groq、DeepInfra、Together AI 等托管网关。Together AI 可直接使用 Cartesia 和 MiniMax 语音: 它的服务器 URL 是 https://api.together.ai/v1, 其文档列出了可粘贴到扩展语音和模型栏的语音名称与模型 id (例如 hexgrad/Kokoro-82M)。

需要自己运行一个代理。ElevenLabs 和 Vertex AI/Gemini 使用各自的 API 格式; LiteLLM 代理可以把它们转换成这种端点形式, 如果您更愿意走代理而不是 Together AI, MiniMax 也可以这样接入。LiteLLM 的运行方法见使用任何其他模型

费用

各项服务自行定价; 开始前请先查看其价格页面: Groq 价格DeepInfra 价格, 或您所选服务的价格页面。要了解托管服务与云服务商的差异, 请参阅我们的服务商对比

用完后移除访问权限

  1. 在服务的控制台中撤销 API 密钥。密钥会立即失效。
  2. 在扩展中打开设置 → OpenAI 兼容, 清除已保存的字段 (或关闭该服务商)。

疑难解答

401 或未授权错误

粘贴的密钥有误或已被撤销。请在服务的控制台生成新密钥, 粘贴到扩展的 API 密钥栏, 再次点击 保存并测试。密钥前后多出的空格也是常见原因。

404 或找不到资源错误

基础 URL 有误: 缺少 /v1 后缀, 或指向了错误的路径。 请严格按照服务 API 文档给出的 OpenAI 兼容基础 URL 复制, 然后重新保存。

语音选择器中没有语音, 或语音不对

扩展会先向服务请求语音列表, 失败时回退到 OpenAI 的标准名称。如果服务的语音没有显示出来, 请在其文档中查到名称, 用逗号分隔填入 语音名称栏, 然后重新保存。

没有声音、语音丢失或键盘快捷键问题, 请参阅疑难解答指南

想用我们没有列出的模型, 或者想要免费的自托管方案? 请改用使用任何其他模型。也可以选择一家云服务商: Amazon PollyAzure SpeechGoogle Cloud TTSOpenAI