2026-06-29 · ⚡ 推理← 本期
Ollama v0.30.11:thinking 检测、Claude Code 自动装载、MLX 投机解码优化
Ollama 的版本更新通常不会在社区引起太多关注,但 v0.30.11 有几个值得解读的方向性变化,超出了常规 bug fix 的范畴。
thinking 检测功能的加入,直接回应了近一年来推理模型在本地部署场景中的需求。具备显式推理链的模型(如 Qwen-thinking 系列、DeepSeek-R 系列)会在输出中包含思维链标记,需要推理框架正确解析和展示这些内容,而不是把 `<think>...</think>` 当作普通输出文本渲染。这个功能本质上是一个协议支持,说明 Ollama 已将 thinking 模型视为主流使用场景而非边缘案例。
自动装载 Claude Code 的支持更有意思。Claude Code 是 Anthropic 推出的 AI 编程助手,通常运行在云端 API 之上。Ollama 为其提供自动装载意味着:用户可以将 Claude Code 配置为指向本地 Ollama 端点,实现完全本地化的代码 agent 工作流。这对数据隐私敏感或网络受限的团队是实质性的改善。
MLX speculative decoding 优化针对 Apple Silicon 用户。MLX 是 Apple 的机器学习框架,speculative decoding 通过草稿模型预生成候选 token 再批量验证来提速。Ollama 对此的优化通常意味着 M 系列芯片用户在本地运行大模型时的 token 生成速度有可感知的提升,具体幅度取决于模型和硬件配置。
Windows Vulkan 修复解决了 NVIDIA GPU 用户在 Windows 上的一个特定兼容性问题,对受影响用户是实用修复。
整体来看,v0.30.11 的更新轮廓是:让 Ollama 更好地支持"有推理能力的模型"和"agent 工具链"——这两个方向恰好是当前本地部署需求增长最快的领域。