凌晨一点的本地模型,为什么值得自己跑
凌晨一点,办公室只剩风扇转动的低声嗡鸣。我把一份不能上传云端的实验记录拖进电脑,等了几秒,忽然意识到:真正让人安心的,不是模型回答得多快,而是这段文字始终没有离开硬盘。于是我开始整理这套本地大模型离线部署方法。Ollama适合命令行、脚本和API调用,LM Studio更像一张可视化工作台。两者都可以免费使用,但前提是电脑要有足够的内存与显存。
先检查硬件:7B模型的Q4量化文件通常约4.5—5GB,建议电脑内存至少16GB;有8GB以上显存时,推理速度会明显舒服一些。没有独立显卡也能运行,只是速度会降到每秒5—10个token左右。我的RTX 3060 12GB测试中,Qwen2.5 7B Q4_K_M平均约35—45 token/s,同一模型改用CPU后约7 token/s。
Ollama下载安装教程:先让模型在终端回答
Windows和macOS直接安装Ollama安装包即可;Linux可以执行下面的官方安装命令。安装完成后,打开终端下载一个适合入门的模型:
curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5:7b
ollama run qwen2.5:7b
第一次下载可能需要几分钟,具体取决于网络和磁盘速度。输入“请用三句话总结本地部署的优点”,模型能正常返回,就说明核心服务已经启动。关闭对话后,可用以下命令确认模型是否留在本机:
ollama list
curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen2.5:7b","prompt":"用一句话介绍你自己","stream":false}'
如果提示连接失败,先执行“ollama serve”;如果下载速度为零,检查代理、磁盘剩余空间和系统防火墙。不要把11434端口直接暴露到公网,本地API默认只应供自己的电脑访问。
LM Studio怎么用:图形界面与本地API
想少敲命令,可以进行LM Studio下载并打开程序,在模型搜索框输入Qwen2.5 7B Instruct,优先选择GGUF格式的Q4_K_M文件。下载后进入Chat页面加载模型;若显存不足,把GPU Offload层数调低,或改用3B模型。然后打开Developer或Local Server页面,点击Start Server,默认地址通常是127.0.0.1:1234。
LM Studio的优势是能直观看到显存占用、上下文长度和生成速度;Ollama则更适合自动化。用下面的请求测试LM Studio API是否正常:
curl http://127.0.0.1:1234/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"local-model","messages":[{"role":"user","content":"写一句欢迎语"}],"temperature":0.3}'
最后的验证很简单:分别重启两个程序,断开网络,再询问同一个问题。如果仍能回答,并且Ollama的“ollama list”与LM Studio的模型目录都能看到文件,离线运行就已经成立。技术有时并不是把世界连接得更远,而是让某些重要的话,安静地留在自己的房间里。