Kapinote logo文档
AI 功能

使用 Ollama 在本地运行 AI

无需 API Key,从安装 Ollama、选择适合 Mac 的 Qwen 模型,到连接 Kapinote 并完成首次本地总结。

Ollama 可以让 Kapinote 直接使用运行在你 Mac 上的 Qwen 大模型。你不需要购买 ChatGPT、Claude 或 Codex,也不需要注册云端 API Key。模型下载完成后,会议文本的总结与问答可以在本机处理。

先区分转录与 AI 总结: Ollama 负责根据会议文字生成标题、摘要、待办和回答问题,不负责把录音转换成文字。如果希望整个流程都在本地运行,请同时在 Kapinote 的语音设置中选择 Apple SpeechQwen3-ASR

开始前需要知道

  • 首次安装需要网络: Ollama 应用和 Qwen 模型都需要先下载——模型可以让 Kapinote 代为下载。完成之后,本地推理可以断网使用。
  • 不需要账号或 API Key: 本地模型不要求登录 Ollama,也不要把其他网站的账号密码填入 Kapinote。
  • Ollama 必须保持运行: 使用 Kapinote 生成总结或进行会议问答时,请不要退出菜单栏中的 Ollama。
  • 系统要求: 本教程仅推荐使用搭载 Apple Silicon(M1 或更新芯片)且运行 macOS Sonoma 14 或更高版本的 Mac。Intel Mac 只能依赖 CPU 推理,速度与使用体验不适合 Kapinote 的本地会议总结,因此不建议配置本地 Ollama。
  • 预留磁盘与内存: 模型文件会占用数 GB 到数十 GB。运行时还需要额外内存保存会议上下文,因此不能只按模型下载大小选择。

如果你只想尽快完成配置,不必研究所有模型:

  • 统一内存 低于 24 GB:使用 qwen3.5:4b
  • 统一内存 24 GB 到 48 GB:使用 qwen3.5:9b
  • 统一内存 48 GB 及以上:使用 qwen3.8:27b

这三档就是 Kapinote 自己判断时使用的分档,所以你看到模型输入框时,里面通常已经填好了正确的值。

第一步:查看 Mac 的芯片、内存与存储空间

  1. 点击屏幕左上角的 苹果菜单  → 关于本机
  2. 记下其中显示的芯片内存,例如“Apple M3 Pro、18 GB”。
  3. 打开 系统设置 → 通用 → 存储空间,确认有足够空间下载模型。

选择模型时,统一内存容量比 M1 / M2 / M3 / M4 / M5 的代际更重要:内存决定模型能否完整装入并为长会议保留上下文;同等内存下,较新的 Pro、Max 或 Ultra 芯片通常只是运行得更快。

第二步:选择适合这台 Mac 的 Qwen 模型

下面的建议以稳定生成会议摘要为目标,并为 macOS、Kapinote 和较长的会议上下文保留了内存余量。下载大小来自 Ollama 模型库;实际运行时的内存占用会更高。

常见 Mac 配置统一内存推荐模型约下载大小使用建议
M1 / M2 MacBook Air、Mac mini8 GBqwen3.5:4b3.4 GB最稳妥的入门选择;关闭占用内存较多的应用后使用
M1 / M2 / M3 / M4 / M5 基础款、M1 / M2 Pro16 GBqwen3.5:4b3.4 GB9B 也装得下,但出字速度只有约三分之一,而摘要质量几乎没有提升
M3 Pro18 GBqwen3.5:4b3.4 GB与 16 GB 是同一个取舍;只有当摘要明显过于笼统时才需要往上换
M4 / M5 Pro24 GBqwen3.5:9b6.6 GB内存带宽足以让 9B 保持跟手
M1 / M2 Pro 或 Max(32 GB)、M3 Max(36 GB)32–36 GBqwen3.5:9b6.6 GBOllama 的 MLX 后端从 32 GB 起启用;能接受回答更慢时,可升级到 qwen3.8:27b
M4 / M5 Pro 或 Max48 GBqwen3.8:27b18 GB第一个能同时容纳 27B 模型和一场长会议的档位
M1 / M2 Ultra、M3 / M4 / M5 Max64 GBqwen3.8:27b18 GB也可尝试 qwen3.6:35b-mlx(约 22 GB)
M1 / M2 / M4 Ultra、M3 / M4 / M5 Max96–128 GB 或更多qwen3.8:27b18 GB优先为超长会议保留上下文;高级用户可试 qwen3.8:27b-mlx-bf16(约 56 GB)

为什么推荐的模型比装得下的更小: 装得下是容易的那一半。Apple Silicon 上的出字速度取决于内存带宽,16 GB 机器的带宽大约只有 48 GB 机器的三分之一。大一档的模型不会报错,它只是慢到让人以为应用坏了。

关于版本名称: Ollama 当前提供的 Qwen3.6 本地模型只有 27B 和 35B 两个主要规格,并没有 qwen3.6:8bqwen3.6:14b。小内存 Mac 应使用 Qwen3.5 的 4B / 9B。Ollama 当前提供的最新 Qwen3.8 本地模型为 27B,适合 32 GB 以上的 Mac。

关于 MLX: 在 Apple Silicon 上,Ollama 会在统一内存 32 GB 及以上的 Mac 自动选用针对 Apple 芯片优化的 MLX 后端,低于该内存则回落到 Metal。这个过程没有开关,也不需要专门的标签。模型库里的 -mlx 标签用于显式锁定该格式,首次配置并不需要——为了标签里的名字重复下载同一个模型没有任何收益。

如果电脑明显卡顿、频繁使用交换空间,或生成一段短摘要需要等待很久,请换到表格上一档更小的模型。更大的参数规模不一定能抵消卡顿、超时和长上下文被截断带来的影响。

如果你选择表格以外的模型: Kapinote 的会议问答会把工具交给模型,让它自己去检索你的会议记录,因此模型必须支持 tool calling。上表中的 Qwen 模型都支持。换用其他模型前,先在它的 Ollama 页面确认带有 Tools 能力标记——否则摘要仍然正常,但问答会失败。

第三步:安装并启动 Ollama

  1. 打开 Ollama 官方下载页面,下载 macOS 版本。
  2. 打开下载得到的 .dmg 文件,将 Ollama 拖入 Applications(应用程序) 文件夹。
  3. 从“应用程序”中打开 Ollama。如果 macOS 询问是否允许打开,请确认允许。
  4. 如果 Ollama 询问是否安装命令行工具或在 /usr/local/bin 中创建链接,请点击允许。后续需要通过该命令下载和检查模型。
  5. 确认屏幕顶部菜单栏中出现 Ollama 图标。使用 Kapinote 时不要退出它。

如果 Ollama 无法安装,请先确认 macOS 已升级到 Sonoma 14 或更高版本。详细系统要求可查看 Ollama macOS 官方说明

第四步:连接 Kapinote 并下载模型

Kapinote 会自己读取 Ollama 的状态,所以这一步不需要手动输入什么,也不需要打开终端。

首次启动的引导中: 在第 4 步「配置 AI 模型」里选择 使用本机模型。不需要在服务商列表里找——这个选项直接进入 Ollama。

之后想改时: 进入 设置 → AI 模型,切到 本地 标签,点击 Ollama 卡片上的 配置

两条路径看到的是同一个面板:

  • 一行状态,显示 Ollama 运行中。如果显示 未检测到 Ollama,说明它没安装或没打开——下载 Ollama 按钮解决前一种情况,打开应用解决后一种,然后点 重新检测
  • 一个已经填好的 Model 字段。Kapinote 会根据这台 Mac 的内存来选,依据与第二步的表格一致,并把本机已有的模型列成一排按钮,点一下即可选中。
  • 当选中的模型本机还没有时,会出现一个带体积的下载按钮,例如 下载 qwen3.5:4b · 3.4 GB。它通过 Ollama 下载并显示进度条。不点它就不会开始下载。
  • Base URL 收在 进阶设置 里,普通的本地配置永远不需要打开它。

然后:

  1. 如果你启动了下载,等它完成。文件有数 GB;中断后重新开始会从断点续传。
  2. 点击 验证。第一次会比较慢,因为模型要先从磁盘读入内存才能回答。对本地模型 Kapinote 允许等待五分钟,而不是给云端 API 的一分钟,所以你不需要自己预热模型。
  3. 点击 保存。首次启动的引导中没有单独的保存按钮——验证时就已经写入配置。两种情况下 Ollama 都会被设为当前使用的服务,卡片上出现勾选标记,不需要再做别的操作。
  4. 选一段较短的会议记录生成一次摘要,或提一个简单问题,完成端到端检查。

Ollama 的本地 API 监听在 localhost:11434。只有当你有意把 Ollama 部署在另一台电脑上时才需要修改 Base URL;普通配置下不要添加 /api,也不要填写网上找到的代理地址。

如果你更习惯用终端

上面的流程完全不需要终端。但终端仍然是查看本机已装模型最快的方式,用它下载模型也一样有效。

  1. 按下 Command + 空格,输入“终端”或“Terminal”,按回车。

  2. 下载模型:

    ollama pull qwen3.5:4b

    百分比持续变化表示正在正常下载。

  3. 确认它能独立回答——这一步可以把「Ollama 的问题」和「Kapinote 的问题」区分开:

    ollama run qwen3.5:4b --think=false

    随便问一句,然后输入 /bye 退出。--think=false 很关键:不加它时 Ollama 会让模型在每次回答前长篇推理一遍,而 Kapinote 不会,模型在终端里会显得比在应用里慢得多。详见关于思考模式

  4. 查看已安装的模型。手动填入 Kapinote 的模型名称必须与这里显示的完全一致,冒号和标签都不能差:

    ollama list

关于思考模式

第二步表格里的每个 Qwen 模型都是思考模型:如果给它机会,它会先写一长串推理再回答。Ollama 对所有支持该能力的模型默认开启这个行为,而它并不便宜。在 M5 Pro 上实测,qwen3.5:4b 回答一句「hi」,开启思考需要 11.1 秒,关闭后只要 0.64 秒——生成 528 个 token 对 27 个,因为其中 500 个是模型在自言自语。

内存带宽更低的 Mac 上,同样的推理会按比例花更长时间。「本地模型没法用」的印象通常就是这么来的,而不是模型太大。

Kapinote 在每一次请求中都关闭了思考,所以你不需要做任何设置。由此有两点:

  • 同一个模型在 Kapinote 里会比在 ollama run 里快得多,因为后者默认开着思考。在终端里对比时请加上 --think=false
  • Kapinote 从不展示也不保存模型的推理过程——它是被直接丢弃的,而不是并入摘要,这正是「开着它只会浪费时间」的原因。

思考无法通过 Modelfile 关闭;而且 Qwen 会忽略同一个设置项对某些其他模型族生效的 low / medium / high 等级,照样长篇推理。只有开关形式真正有效,而 Kapinote 已经在发送它了。

关于上下文长度

Ollama 给每个模型分配的上下文长度是固定的,而它的默认值取决于可用内存、而不是模型本身的能力:低于 24 GB 时是 4k tokens,大约只有十分钟会议的量。第二步表格中的 Qwen 模型本身都支持 256k。

这个默认值会悄悄毁掉摘要质量:生成摘要时发送的是整份会议记录,装不下的部分在模型读到之前就被丢弃,而且不会有任何报错——摘要只覆盖会议的后半段,看起来像模型能力不行。Kapinote 在每次请求中都会指定一个更大的窗口,所以这件事已经处理好了,你不需要做任何设置。

具体调到多大取决于这台 Mac 的内存:上下文保存在 KV 缓存里,与模型占用同一块内存,按台式机的标准取值可能会让一台笔记本连原本跑得动的模型都加载不了。

统一内存Kapinote 请求的窗口
低于 12 GB8k
12–32 GB16k
32 GB 及以上32k

这里的内存分档与第二步的表格不一致,这是有意的:模型表关心的是这台 Mac 能把模型带多快,而这张表关心的是 KV 缓存可以在模型之外额外占用多少内存。

有两点值得知道:

  • 如果这台 Mac 在生成摘要时开始频繁使用交换空间,应该回到第二步换用小一档的模型,而不是在这里做调整。
  • 在 Ollama 一侧设置 OLLAMA_CONTEXT_LENGTH 不会影响 Kapinote 的请求,因为请求自带了该值。如果确实需要覆盖它(内存特别小的 Mac,或特别长的会议),请设置 KAPINOTE_OLLAMA_NUM_CTX 后重启 Kapinote。

常见问题

看到的问题处理方法
command not found: ollama确认 Ollama 已安装并正在运行;关闭终端重新打开;再次启动 Ollama 并允许安装命令行工具
Kapinote 提示无法连接或 connection refused打开 Ollama,确认菜单栏图标存在;将 Base URL 恢复为 http://localhost:11434
提示 model not found打开 Kapinote 的 Ollama 面板,从那排按钮里选择模型;本机没有时用面板上的下载按钮获取
下载中断保持 Ollama 开启、网络恢复后重新开始——Ollama 会保留已写入的部分并续传
磁盘空间不足在“系统设置 → 通用 → 存储空间”释放空间,或用 ollama rm 模型名称 删除不再使用的模型
Mac 明显卡顿或频繁出现内存警告换用更小模型:27B 改为 9B,9B 改为 4B
重启 Mac 后突然无法连接先重新打开 Ollama,再启动 Kapinote 并验证
验证超时五分钟仍不足以载入模型。关闭浏览器大量标签、游戏或编译工具,或回到第二步换用小一档的模型
生成摘要时 Mac 卡顿或频繁使用交换空间上下文窗口会在模型之外额外占用内存;回到第二步换用小一档的模型
问答失败但摘要正常该模型不支持 tool calling,换用第二步表格中的 Qwen 模型
同一个模型在终端里比在 Kapinote 里慢很多属于正常现象。ollama run 默认开启思考,而 Kapinote 关闭了它;改用 ollama run 模型名称 --think=false 重试
隔一段时间后第一次请求又变慢Ollama 会在闲置约五分钟后卸载模型,下次请求时重新载入。运行 launchctl setenv OLLAMA_KEEP_ALIVE "30m" 并重启 Ollama 可以让它驻留更久

如果仍然失败,请先确认模型能否在终端中通过 ollama run 模型名称 正常回答。终端也无法运行时,应优先排查 Ollama;只有终端正常而 Kapinote 验证失败时,再前往 Kapinote 故障排查生成诊断报告。

隐私边界

  • 下载 Ollama、更新应用和下载模型文件时需要访问网络。
  • 使用表格中的本地模型标签,并保持 Base URL 为 http://localhost:11434 时,Kapinote 会把会议文本发送给这台 Mac 上的 Ollama 服务处理。
  • 不要选择带有 :cloud 的模型标签;Cloud 模型会使用 Ollama 的在线服务,不属于完全本地推理。
  • 如果把 Base URL 改成另一台电脑或公司服务器的地址,会议文本会被发送到该地址;此时应自行确认网络与数据安全策略。

模型标签与下载大小可能随 Ollama 更新而变化。选择其他 Qwen 模型前,建议先在 Ollama Qwen 模型库确认准确标签。