用Page Assist打造本地AI工作台:Ollama+DeepSeek浏览器扩展配置指南
简介Page Assist 是一套面向 Chrome 与 Firefox 的本地 AI 模型 Web UI 插件核心价值在于让用户通过浏览器界面直接调用 Deepseek 等本地模型无需依赖云端服务即可获得智能交互体验。Chrome 版本已实测通过 Deepseek R1 验证Firefox 版插件同步提供适合希望在浏览器中搭建自定义 AI 助手的开发者与进阶用户。压缩包内含 131 个文件整体约 11.97MB。其中 45 个 js 脚本承载插件主逻辑与页面交互2 个 html 对应侧边栏和选项配置界面json 文件保存清单与配置参数ttf/woff/woff2 字体资源为界面图标与排版提供支持png 图片和 css 样式完善视觉呈现另含 wasm、gz 等资源用于本地模型推理与语言数据。文件结构清晰便于直接安装或二次开发。该包目前已有 9731 人浏览学习。通过分析 manifest、content-scripts、chunks 等目录可快速理解插件从后台逻辑到注入脚本的运行机制并借 sidepanel 配置自定义知识库与交互选项对于想深入浏览器 AI 插件开发或改造模型交互界面的读者这是一份可操作性很强的参考实现。 在本地跑大模型最难的不是环境搭建而是跑起来之后不知道拿它干什么。我第一次用命令行走起 DeepSeek 模型时问几句确实惊艳但扭头回到浏览器查资料又得复制粘贴一大段文本回终端来回几次新鲜感就没了。直到装上 Page Assist——一个专门给本地 AI 模型当 Web UI 的浏览器扩展这个循环才算是彻底打通。Page Assist 做的事很朴素在 Chrome 或 Firefox 里放一个常驻侧边栏直接对接本机的 Ollama、LM Studio 等推理服务支持页面内容分析、选中文字问答、多轮对话而且所有数据只在本机流转。这篇文章我把模型选型、本地部署、扩展配置、踩坑排查完整过一遍目标很直接让你照着文章顺下来就能拥有一套随时可用的私有 AI 工作台。1. 本地模型不缺能力缺一个像样的入口命令行里的 ollama run 交互并不差但一旦进入真实工作流痛点就全暴露了。正看一篇长文档想让它总结得先全选复制再切回终端粘贴选中一段代码要解释同样要手动搬运。更难受的是终端没有当前上下文的概念想让模型理解这个网页在讲什么你得把整页文字都塞进去。这种割裂感会让你慢慢放弃使用本地模型问题其实不在模型能力上而在入口设计上。Page Assist 的定位恰好填在这个缺口。它是个浏览器插件不是又一个需要单独部署的服务端应用。相比 Open WebUI、LobeChat 这类独立 Web 界面浏览器扩展的好处是轻装完就有开浏览器就在不需要额外维护端口和服务。对已经用 Ollama 的人来说它更像是补齐最后一公里的那块拼图。隐私这点也值得单独说。所有请求都发往 localhost模型跑在自己机器上对话内容不经过任何第三方服务器。我处理涉及内部信息的资料时不敢往云端对话框里贴本地 Web UI 就没有这层顾虑。后面的部署过程你也会看到整条链路没有任何一个环节依赖外部服务。2. 模型选型DeepSeek 本地版怎么挑尺寸现在本地可选模型确实多Qwen、Llama、Mistral 都有不错的版本。但如果你要的是推理能力强、中文好、权重开放DeepSeek 系列是目前综合性价比很突出的选择。Ollama 仓库里的 deepseek-r1 系列是官方蒸馏出来的小模型版本1.5b 到 70b 都有尺寸越大推理能力越强硬件门槛也水涨船高。模型标签量化后体积最低内存参考适用场景deepseek-r1:1.5b约 1.1GB2GB低配机器日常问答deepseek-r1:7b约 4.7GB8GBCPU 也能跑的入门档deepseek-r1:8b约 4.9GB8GB与 7b 体感接近deepseek-r1:14b约 9.0GB16GB大多数人的甜点档deepseek-r1:32b约 20GB32GB需要更强推理时deepseek-r1:70b约 43GB48GB高端显卡尝鲜我自己的选择逻辑很简单先看内存总量再决定往哪一档走。16GB 内存的机器跑 14b 比较舒服8GB 内存老老实实用 7b 或 8b别为了越大越强硬上大模型。内存不够时系统会疯狂使用交换分区输出速度断崖式下跌体验远不如小模型。网页摘要、日常问答这类轻任务7b 完全够用复杂代码推理、长链路逻辑分析再临时切到 14b 或 32b。还有一个容易被忽略的点deepseek-r1 这类推理模型会先输出一段思考过程reasoning_content再给出最终结论。命令行里看这段思考很费劲但在 Page Assist 里可以完整展开这对理解模型为什么给出某个答案、以及调试提示词都很有帮助。3. Ollama 部署实录从拉取模型到验证 API3.1 安装 Ollama三步搞定Ollama 的安装没有值得纠结的地方。Windows 直接下载安装包一路下一步macOS 用 brew install ollamaLinux 用官方脚本一行命令。装完之后模型管理、API 服务、模型驻留这些底层细节都帮你处理好了不需要手动配 Python 环境也不用折腾 llama.cpp 的编译参数。对绝大多数人来说这是本地跑模型最省心的路径没有之一。3.2 拉取 DeepSeek 并验证服务# 拉取 14b 模型约 9GB耐心等待 ollama pull deepseek-r1:14b # 命令行试跑确认模型能正常回答 ollama run deepseek-r1:14b # 另开一个终端验证 API 服务是否在线 curl http://localhost:11434/api/tagscurl 这一步很关键。Page Assist 是浏览器扩展它不直接调用模型而是通过 HTTP 请求访问 Ollama 在 11434 端口暴露的 API。如果 curl 能返回一串模型列表的 JSON说明本地服务已经就绪后面配置扩展只是填地址的功夫。如果 curl 失败先确认 Ollama 真的在运行Windows 看托盘图标macOS 看菜单栏进程Linux 用 systemctl status ollama 查一下。3.3 端口监听这个细节别乱动Ollama 默认只监听 127.0.0.1也就是仅本机可访问这是非常正确的默认行为。有人为了让手机或局域网内其他电脑也能访问会去改 OLLAMA_HOST0.0.0.0我建议没有明确需求就不要动。一旦监听所有网卡局域网里任何设备都能向你的模型发请求既不安全也白白消耗本机资源。后面接 Page Assist 走 localhost 就够了没必要冒这个风险。4. Page Assist 安装与连接核心配置就三个字段4.1 安装入口在 Chrome 应用商店或 Firefox 附加组件商店搜索 Page Assist装好后固定到浏览器工具栏。点开图标默认就是侧边栏聊天界面首次使用会引导你配置 provider如果没弹出来进设置页手动添加也不难。扩展本身是开源的源码在 GitHub 上有洁癖的可以自己过一遍再装。4.2 连接 Ollama 的三个字段设置里的核心信息其实只有三样Provider 选 OllamaBase URL 填 http://localhost:11434API Key 留空不填。填完点连接正常情况下模型列表会自动刷出来把 deepseek-r1:14b 设为默认模型就能开始聊天。提示Base URL 一定是 http 而不是 https。本地服务没有证书填 https 必连不上。如果你用的是 LM Studio它的接口地址是 http://localhost:1234/v1Provider 要选 OpenAI Compatible 兼容模式。我第一次在这里卡了一会儿以为地址对就行结果 provider 类型选错填什么都白搭。本质原因是 Ollama 和 LM Studio 的 API 形态有差异扩展用不同的适配器去对接选错类型等于拿错了插头。4.3 连接失败时的第一排查顺序连接失败先别急着翻扩展配置。按这个顺序来先在终端执行 curl确认服务活着再 ollama list 确认模型存在最后才回来检查地址、协议、provider 类型。这样能快速区分服务没跑和配置错了避免在错误方向上反复试。我的经验是八成以上的连不上都出在前两步。5. 把侧边栏用进日常四种高频场景5.1 侧边栏随叫随到Page Assist 默认以侧边栏形式挂在浏览器里任意页面都能呼出。我最常用的姿势是查资料时开着它遇到不懂的概念直接贴进去追问。相比终端这个入口不打断浏览节奏阅读、提问、再阅读的循环非常顺滑用久了真的会形成肌肉记忆。5.2 让模型读整个页面这是 Page Assist 最有价值的功能之一。看完一篇长文点一下与当前页面聊天模型就能基于整页内容做总结、提炼要点、查找关键信息。对比传统做法它省掉了复制全文、粘贴进对话框、手动组织上下文的一整套流程。需要注意页面过长会消耗大量上下文窗口遇到特别长的文档先选中关键段落再让它分析效果更稳。5.3 选中文本直接问网页上选中一段文字扩展就能让模型翻译、解释、改写、总结。这个功能我使用频率最高看英文文档时选中一段要翻译读代码时选中一个函数问逻辑讨论某个观点时选中原文要评价。相当于在浏览器里给本地模型加了一个全局右键菜单属于用了就回不去的功能。5.4 建议先改的三个设置第一个是默认系统提示词。给模型设定回答保持简洁、不确定时直接说明比默认行为省心得多。第二个是温度参数本地模型做事实问答时调低一点比如 0.3 左右可以减少自由发挥做文案创作再调回 0.7 以上。第三是同时配置多档模型我常用 7b 处理快问快答、14b 做日常主力、32b 留给复杂推理在 Page Assist 里切换模型只是下拉框点一下的事。6. 踩坑复盘连不上、列表空、响应慢的完整链路6.1 扩展一直显示连不上我遇到的第一种情况是系统重启后忘了启动 Ollama服务没跑扩展自然连不上这属于低级失误。第二种是地址填成了 https本地没有证书肯定失败。第三种比较隐蔽同时装了多个本地推理服务导致端口混乱比如 LM Studio 的 1234 和 Ollama 的 11434 记混。按 4.3 的顺序排查基本都能快速定位。6.2 模型列表是空的扩展连上了服务但模型下拉列表空无一物大概率是 Ollama 里一个模型都没拉或者之前拉取时中断了。先执行 ollama list 确认本机模型有模型但扩展不显示重新点一次连接或刷新页面扩展会重新拉取模型清单。另外模型标签要完全对得上deepseek-r1:14b 和 deepseek-r1:latest 是两个不同的标识选错一样会报错。6.3 首条回复慢得像卡死很多人第一次问完就以为模型挂了其实那是模型文件正在从磁盘加载进内存。Ollama 模型默认驻留一段时间冷启动确实要等这在 32b 这种大模型上尤其明显。如果日常频繁使用可以把 keep_alive 参数调长让模型常驻内存如果只是偶尔用接受首次等待就好。需要特别提醒16GB 内存的机器硬跑 32b首次加载会非常吃力这属于硬件边界不是故障。6.4 小模型的回答不太靠谱本地小模型的能力边界客观存在7b 做事实问答偶尔会一本正经地胡说涉及具体数字时尤其明显。我的处理办法有两个一是让它把推理过程完整输出借助思考部分判断答案可信度二是把问题拆细小模型对分步引导的响应远比一步到位的复杂指令稳定。这条经验不只适用于 DeepSeek所有本地模型都适用。7. 一套本地服务多个入口复用7.1 Ollama 的接口为什么能到处接Ollama 很早就支持 OpenAI 兼容接口路径是 /v1。这意味着任何只认 OpenAI API 的工具把 Base URL 换成 http://localhost:11434/v1模型名写成 deepseek-r1:14b理论上就能跑。Page Assist 只是第一个入口不是唯一入口。7.2 编码助手与桌面客户端的复用我用 Codex 和 Cline 试过接本地 DeepSeek配置方式大同小异Base URL 指向 Ollama 的 /v1API Key 随便填一个占位符本地服务不校验模型选 deepseek-r1:14b。实测做代码解释、注释补全、提交信息整理这些任务很稳。但要提醒一句小模型的工具调用能力有限别指望它像云端的旗舰模型那样自主改代码、跑测试它更适合当代码陪聊而不是自动驾驶。桌面客户端 Chatbox、Cherry Studio 这类工具同样支持自定义服务地址填法和上面一样。我现在的工作流是浏览器问答默认 14b网页长文总结交给页面聊天复杂推理临时切 32b编码工具里挂 7b 处理轻量任务。模型相同、入口不同、各干各的活。要说最大的感受就是本地有模型这件事终于从尝鲜玩具变成了每天离不开的生产力工具。如果你也在用 Ollama或者正打算把 DeepSeek 跑在本地我建议装好模型之后第一件事就是配上 Page Assist打开侧边栏问一句你最关心的问题你会立刻理解我说的这种体验。本文还有配套的精品资源点击获取