语音转录
云端转录服务
连接 Soniox、Deepgram、AssemblyAI 或 ElevenLabs,详细了解各项转录参数与高级控制。
云端转录服务会将实时音频流加密传输至你所配置的第三方语音 API。在接入前,请先在对应服务商控制台注册账号、了解计费规则与数据隐私条款,并建议专为 Kapinote 创建独立的 API Key。
连接步骤
- 打开 设置 → 语音,在模型列表中选择对应的云端服务商。
- 点击 配置 并粘贴你的 API Key。
- 除非你的企业账号使用了私有网关或专属部署,否则请直接保留默认的 Model 与 Base URL。
- 按需配置语言提示(Language Hints)、说话人区分(Diarization)与智能断句(Endpointing)。
- 点击保存并运行内置测试,确保认证与网络连通正常。
API Key 提示: 复制粘贴 API Key 时请注意去除首尾多余的空格或双引号。如测试失败,请先前往服务商后台确认该 Key 具备实时语音转录权限且账号有可用余额。
1. Soniox
- 获取密钥: 按照 Soniox 快速开始文档 创建 API Key。
- 默认配置: 默认模型为
stt-rt-v4,默认 WebSocket 地址为wss://stt-rt.soniox.com/transcribe-websocket。 - 语言提示机制: 支持同时指定一个或多个语言提示(Language Hints)。Soniox 官方说明语言提示用于增强目标语种的识别概率,但不会强行限制非目标语种的识别;详见 Language hints 文档。
- 高级能力: 原生支持高精度的说话人区分与智能断句检测。
- 语种支持: Kapinote 预置了最常用的语言快捷选项,Soniox 官方底层支持 60+ 种语言。详见 Soniox 支持语言列表。
2. Deepgram
- 获取密钥: 登录 Deepgram Console 创建 Project API Key,参考 Deepgram 密钥创建指引。
- 默认配置: 默认使用最新代 Nova-3 模型,默认地址为
wss://api.deepgram.com/v1/listen。 - 语言与多语言模式: 支持指定单一语言或开启模型的多语种混合识别。
- 关键词增强(Keyterm Prompting): Kapinote 支持向 Deepgram 最多传入 100 个自定义词条(每个最多 50 字符)。Nova-3 会自动采用 Deepgram 的 Keyterm Prompting 机制 强化专有名词识别。
3. AssemblyAI
- 获取密钥: 在 AssemblyAI 仪表盘中创建并复制 API Key。
- 默认配置: 默认使用
universal-streaming-multilingual模型,地址为wss://streaming.assemblyai.com/v3/ws。 - 语言设置: 支持自动语种检测,或显式指定英语、西班牙语、法语、德语、意大利语、葡萄牙语等。
- 自定义词汇: 最多支持传入 100 个专有词条(每个词条上限 50 字符)。
- 更多规范请参考 AssemblyAI Streaming API 文档。
4. ElevenLabs
- 获取密钥: 在 ElevenLabs 控制台的 API Keys 页面生成密钥。
- 默认配置: 默认采用
scribe_v2_realtime模型,地址为wss://api.elevenlabs.io/v1/speech-to-text/realtime。 - 语言模式: 支持自动检测或在下拉列表中选择指定语种。
- 自定义词汇: 最多支持传入 50 个专有词条(每个词条上限 20 字符)。
- 覆盖详情可参考 ElevenLabs 的 Speech to Text 概览 与 Realtime API 文档。
语言配置差异说明
各服务商的语言控制逻辑存在差异:Soniox 允许输入多个语言提示(Hints),Deepgram 区分单语种与多语种模式,而 AssemblyAI 与 ElevenLabs 则提供端侧自动检测。此外,各服务商不同模型在不同地区的语言支持可能有所差异,建议在正式会议前完成 30 秒的实录验证。