雨夜里,把模型留在自己的电脑上
那天凌晨一点,窗外的雨敲在空调外机上,像一串不耐烦的键盘声。我正在整理一份客户访谈记录,网络忽然断了,云端聊天窗口只剩下转圈。那一刻我突然明白,所谓AI生产力,有时并不是更聪明的问题,而是它能不能在你需要的时候安静地待在本地。于是我把一台16GB内存、RTX 3060 12GB显存的旧主机拖出来,开始做这次Ollama本地部署教程和LM Studio教程的实测。
先说结论:如果你习惯命令行、想接API,用Ollama;如果你想点点鼠标、快速试模型,用LM Studio。免费官方路线已经足够完成离线问答、资料摘要、代码解释。它的限制也很清楚:本地模型不会自动联网,7B模型中文可用但复杂推理不如Claude、GPT这类云端大模型;如果你还在搜索“Claude注册方法”“Claude怎么用”或“Claude免费使用”,本地部署更像一个稳定备胎,而不是完全替代。
Ollama下载与部署:先让命令行有回应
到Ollama官方安装包下载并安装,Windows安装后重新打开PowerShell,macOS可直接用安装器。验证是否成功,输入:
ollama -v
接着拉一个适合多数电脑的模型。我实测qwen2.5:7b在中文写作和总结上比较稳,模型约4.7GB;如果只有8GB内存,先用3B模型更现实。
ollama pull qwen2.5:7b
ollama run qwen2.5:7b
如果你想让其他软件调用本地模型,Ollama默认会在11434端口提供服务。可以用下面命令测试API是否通:
curl http://localhost:11434/api/generate -d "{\"model\":\"qwen2.5:7b\",\"prompt\":\"用三句话解释什么是本地大模型\",\"stream\":false}"
我用一段300字中文提示词测试,RTX 3060上首字延迟约800毫秒,输出速度约35 token/s;同一模型在纯CPU的16GB笔记本上约5到8 token/s,能用,但等待感明显。测量方法很简单:从回车到第一段文字出现用手机秒表计时,再用Ollama输出速度日志估算。
LM Studio怎么用:给不想碰命令行的人一盏灯
LM Studio下载后,打开搜索模型,建议优先找GGUF格式,比如Qwen2.5 7B Instruct、Llama 3.1 8B Instruct。量化版本选Q4_K_M通常是甜点位:体积小、质量损失可接受。7B Q4模型一般4GB到5GB,适合16GB内存;13B或14B模型建议至少32GB内存,否则会像深夜拥堵的高架,慢得让人怀疑人生。
下载完成后进入Chat界面,选择模型并设置上下文长度。普通办公摘要设4096即可,长文档可试8192,但内存会明显上涨。Temperature建议:事实问答0.2到0.4,创意写作0.7左右。若要兼容OpenAI格式,在Local Server里点击Start Server,默认地址通常是:
http://localhost:1234/v1
常见故障也别慌。模型加载失败,多半是内存不足,换Q4或更小参数;回答乱码,确认模型是Instruct版本;速度异常慢,检查是否启用GPU Offload,NVIDIA显卡更新驱动后再试;端口占用,就把LM Studio server端口改成1235。
如何验证它真的可用
别只问“你好”。请用三个任务验收:第一,断网后提问“总结这段会议记录”,确认仍能回答;第二,让它改写一段500字中文,观察是否跑题;第三,用API请求本地端口,确认返回JSON。若三项都通过,你的本地大模型离线部署就不是摆设,而是一台真正能陪你熬夜的工具。
如果你希望把本地模型、云端模型和日常AI工具入口放在一个更顺手的工作台里,睿盈工具整理的方案也可以作为参考之一:wizzegroup.com。当然,官方免费安装、自己调参,永远是最值得先走一遍的路。