跳转到内容

离线与私有化 AI 阅读:Yomitomo + Ollama 本地大模型伴读实战

随着大语言模型在学术研究、商业尽调和代码审查中的深度应用,一个棘手的矛盾日益突出:越是高价值的深度阅读材料(未公开的专利草稿、商业投资底稿、前沿论文、核心代码长文),越无法随意上传至第三方商业云端 API

此外,在国际长途航班、高铁无网区或涉密内网环境下,依赖云端网络的 AI 阅读器往往彻底瘫痪。

Yomitomo 原生支持接入本地推理引擎(如 OllamaLM Studio),配合本地量化大模型,构建真正100% 物理隔离、零数据外发、脱网全功能的私有化深度阅读工作流。


本地私有化 AI 伴读架构与数据流

Section titled “本地私有化 AI 伴读架构与数据流”
流程节点 输入 (Input) 系统本地处理 (System Processing) 交付结果 (Output) 安全与隔离边界 (Boundaries)
模型部署 Ollama 本地推理服务运行(如 qwen2.5deepseek-r1 本机 GPU/CPU 启动 http://localhost:11434 本地 HTTP 服务 本地模型就绪,具备高速离线推理能力 零外部网络请求,权重文件存放在本地磁盘
端点配置 在 Yomitomo 输入 http://localhost:11434/v1 本地校验端点并映射至各伴读与审阅角色 本地模型成功绑定 @周砚@何明衡 等助手 无需外部 API Key,零订阅费用
划线思辨 选中文本按 A,在讨论区 @ 助手发起提问 Yomitomo 本地提取锚点上下文,组装 Prompt 直接 POST 本地端点 本地 GPU 毫秒级生成针对段落的逻辑审问与概念辨析 请求包仅在 localhost 环路流转,绝不出机
知识沉淀 T 开启沉淀工作台,由审阅助手复核草稿 本地模型完成逻辑漏洞排查与文字精炼 生成高密度 Markdown 沉淀卡片并保存至 SQLite 沉淀产物完全离线归档,支持永久本地复用

4 步完成 Yomitomo + Ollama 离线伴读配置

Section titled “4 步完成 Yomitomo + Ollama 离线伴读配置”
  1. 访问 Ollama 官网 下载对应系统的安装包(macOS / Windows / Linux)。
  2. 在终端拉取并运行你偏好的模型(推荐用于阅读分析的模型):
    Terminal window
    # 推荐 1:阿里开源 Qwen 2.5(中英文理解与概念解析极佳)
    ollama run qwen2.5:14b
    # 推荐 2:DeepSeek-R1 蒸馏版(推理与批判性逻辑分析能力极强)
    ollama run deepseek-r1:14b

第二步:在 Yomitomo 中配置本地 Provider

Section titled “第二步:在 Yomitomo 中配置本地 Provider”
  1. 打开 Yomitomo,进入「设置 > AI 模型」。
  2. 点击「添加 Provider」,配置以下参数:
    • Provider 类型:选择 Custom / OpenAI Compatible
    • Base URL:填入 http://localhost:11434/v1
    • API Key:可随意填写任意占位字符(如 ollama,本地服务无需鉴权);
    • 模型名称:填写你拉取的本地模型名称(例如 qwen2.5:14bdeepseek-r1:14b)。
  3. 点击「测试连接」,提示连接成功后保存。

第三步:为伴读与审阅助手绑定本地模型

Section titled “第三步:为伴读与审阅助手绑定本地模型”

在「设置 > AI 助手」中,你可以将所有伴读助手(@林知微@周砚@沈清源)和审阅助手(@何明衡@梁证言@唐简)的底层模型统一指定为你配置的 Ollama 本地模型。

拔掉网线或开启电脑飞行模式,打开一本本地 EPUB 或 PDF 论文:

  • 选中文本按下 A 键创建批注;
  • 在讨论区输入 @周砚 审查此处推论的必要条件
  • 本地 GPU 立即开始高速推理,生成严谨的思辨分析;
  • 按下快捷键 T 打开沉淀工作台,收敛形成终身知识卡片。

硬件环境 推荐模型规格 优势场景 预期推理速度
Mac M1/M2/M3 (16GB 统一内存) qwen2.5:7bdeepseek-r1:8b 概念快速翻译、常规段落逻辑审阅 30~45 tokens/s
Mac M2/M3/M4 Pro/Max (32GB+ 内存) qwen2.5:14bdeepseek-r1:14b 深度学术推导、严密逻辑复核、复杂上下文把握 20~35 tokens/s
PC + RTX 4070/4080 (12G/16G 显存) qwen2.5:14b-instruct 极高速度本地长文精读与段落辩论 40~60 tokens/s

  • 涉及商业机密、未公开专利、敏感科研数据的企业研发人员与学者;
  • 经常在差旅(机舱、高铁)等无网络环境下需要深度研读与写作的知识工作者;
  • 拥有强大本地硬件(Apple Silicon Mac 或高端英伟达显卡)、追求零成本无限 Token 推理的极客玩家。
  • 电脑配置较低(如仅 8GB 内存且无独立显卡):运行 14B 以上大模型可能出现卡顿,建议使用轻量 7B 模型或配置云端 API;
  • 依赖联网实时搜索事实:本地模型无内置搜索引擎,聚焦于针对所给段落与上下文的逻辑推演和概念拆解

Q1:在 Windows 上使用 Ollama 时需要开启哪些端口或防火墙设置?

Section titled “Q1:在 Windows 上使用 Ollama 时需要开启哪些端口或防火墙设置?”

答: Ollama 默认监听本地 http://localhost:11434。只要 Yomitomo 和 Ollama 在同一台电脑上运行,无需修改防火墙,即可通过本地环回地址畅通连接。

Q2:使用本地大模型伴读,会消耗电池和产生发热吗?

Section titled “Q2:使用本地大模型伴读,会消耗电池和产生发热吗?”

答: Yomitomo 仅在读者主动 @ 唤起助手或在沉淀窗口进行审阅时触发局部推理(单次仅生成数百 Token),并非全天持续高负荷运行,因此对笔记本电量和发热影响非常轻微。