Kapinote logo文档
语音转录

选择转录模型

从隐私安全、配置难度、多语言/方言覆盖与网络依赖等多维度对比本地端侧与云端转录引擎。

打开 设置 → 语音,可以自由挑选并实测用于新会议录制的语音转录模型。最适合的引擎取决于你的 macOS 系统版本、会议语言偏好、隐私合规级别以及设备是否处于离线环境。

引擎横向速览

转录模型运行位置配置要求最适用场景
Apple SpeechMac 本地系统引擎仅需授权“语音识别”权限;依赖系统已下载的语言资源包兼容 Mac 上的零开销轻量端侧转录
Qwen3-ASR 0.6BMac 本地独立运行在 Kapinote 内一键下载模型权重(约 1.2 GB)100% 离线使用、复杂多语言及 22 种中文方言对话
Soniox RealtimeSoniox 云端填入 API Key跨国团队实时多语言交流与高频中英混杂会话
Deepgram NovaDeepgram 云端填入 API Key需要极低延迟、精准说话人区分(Diarization)与自定义关键词
AssemblyAI StreamingAssemblyAI 云端填入 API Key依赖自动语种识别的欧美主流语言会议
ElevenLabs ScribeElevenLabs 云端填入 API Key追求极高转录准确率与丰富云端多语种覆盖

云端服务商的功能支持与配额政策可能动态更新。Kapinote 界面仅呈现当前版本已深度集成的配置项;计费标准、地区限制与模型版本周期请参阅各服务商官方文档。

本地端侧模型(隐私优先)

本地端侧转录绝不向任何外部 API 发送会议音频,所有模型权重下载就绪后即可在无网络环境下顺畅工作。与此同时,它会占用部分 Mac 的 CPU、GPU、统一内存与存储空间。建议先运行内置测试,验证当前硬件规格下的实时转录流畅度与准确率。

  • Apple Speech: 最轻量省电,无额外磁盘占用,适合系统版本支持的标准普通话或英语交流。
  • Qwen3-ASR: 由阿里开源的业界顶尖 ASR 模型,官方原生支持 30 种全球语言与 22 种中文方言及地方口音。详见 Qwen3-ASR 语言与方言列表

云端转录服务(性能与拓展)

云端转录将音频流实时传输至你自主配置的服务商。这种方式几乎不消耗本机计算资源,并通常提供更强大的断句与说话人识别能力,但需要稳定的网络连接、有效的 API Key 以及可用余额。详见 云端转录服务配置

选型决策检查清单

  • 涉密或保密协议(NDA)会议: 优先选用本地模型(Apple Speech / Qwen3-ASR),确保原始音频不出设备。
  • 中英夹杂或方言环境: 推荐使用 Qwen3-ASR(本地)或 Soniox(云端)。
  • 行业术语与特殊人名: 配置 自定义词汇 消除生僻词识别偏差。
  • 出差或飞行途中: 提前在有网络时完成 Qwen3-ASR 权重下载并做一次试录。

提示: 更改转录模型仅对后续发起的新录制生效,已完成的历史会议记录不会自动重新转录。