🤖 离线跑大模型实操:用 Ollama 和 LM Studio 搭一台自己的本地 AI 工作台

首页 › 离线跑大模型实操:用 Ollama 和 LM Studio 搭一台自己的本地 A
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

凌晨两点,把模型请进自己的电脑

Q1需求调研Q2产品开发Q3内测上线Q4全面推广

凌晨两点,窗外的雨打在空调外机上,像一段没有剪辑好的白噪音。我那时正盯着浏览器里反复转圈的 AI 对话窗口,文档里还有一段客户资料不适合上传云端。你也许有过这种犹豫:Claude怎么用很方便,Claude免费使用也足够轻量,可一旦涉及合同、代码、实验记录,问题就变成了——能不能让模型留在本地,不把文字交给远方的服务器?

这篇不是泛泛而谈的本地大模型部署教程。我按自己实际测试过的路径来写:Ollama 负责命令行和 API,LM Studio 负责图形界面和模型管理。免费、官方、可离线,是它们最大的好处;限制也明显,本地推理速度取决于你的 CPU、内存、显存,别指望一台老轻薄本跑出云端 Claude 的流畅感。

先判断机器,再安装 Ollama 与 LM Studio

部署前先看配置。我的测试机是 Windows 11,32GB 内存,RTX 3060 12GB;同一模型在这台机器上首 token 延迟约 600-1200ms,使用 LM Studio 内置监控观察 token/s,Qwen2.5-7B-Instruct-Q4_K_M 大约 25-38 token/s。如果你只有 16GB 内存,建议从 7B、8B 的 Q4 量化模型开始;如果是 8GB 内存,优先试 3B 或 4B,不要一上来下载 70B。

  1. 安装 Ollama。搜索“Ollama下载”,选择对应 Windows、macOS 或 Linux 安装包。安装后打开终端,输入:

    ollama --version

  2. 拉取一个中文表现稳定的模型。第一次下载可能需要几分钟到几十分钟,7B Q4 模型通常约 4GB:

    ollama pull qwen2.5:7b

  3. 运行模型并直接对话:

    ollama run qwen2.5:7b

  4. 如果你想让其他工具调用本地模型,确认 Ollama 服务在本机 11434 端口:

    curl http://localhost:11434/api/tags

接着做 LM Studio。搜索“LM Studio下载”,安装后进入模型搜索页,关键词可用 qwen2.5、llama、mistral。下载 GGUF 格式模型时优先选 Q4_K_M:它在体积、速度、质量之间比较均衡。这个步骤很适合不喜欢命令行的人,因为你能看到模型大小、量化版本和运行状态。

让它真正可用:模型选择、接口测试与故障排查

85%转化提升2.5s响应速度100+功能模块365天持续更新

我常用的组合是:Ollama 跑后台接口,LM Studio 做可视化测试。若你写代码,可把 Ollama 当作一个本地 OpenAI 风格服务。比如测试生成:

curl http://localhost:11434/api/generate -d '{"model":"qwen2.5:7b","prompt":"用三句话解释本地大模型怎么用","stream":false}'

如果返回 JSON 且 response 字段有内容,说明接口通了。若报错“model not found”,先执行 ollama list 看模型名是否一致;若非常慢,打开任务管理器看显存是否占满,显存爆掉后会回落到 CPU,速度可能从 30 token/s 掉到 2 token/s。若 LM Studio 无法启动服务器,在 Local Server 页面确认端口没有被占用,默认常见端口是 1234。

模型怎么选?中文办公、摘要、改写,Qwen2.5-7B 足够起步;代码问答可试 DeepSeek Coder 6.7B 或 Qwen2.5-Coder;英文推理可试 Llama 3.1 8B。别贪大,先问自己:我要的是隐私、本地接口、断网可用,还是追求最强回答?这三个答案,会决定你该下载 4GB 的模型,还是为 40GB 的模型升级硬件。

如果你原本在查 Claude注册方法,只是为了处理长文档,那么本地模型适合先做初筛、摘要和敏感信息处理;遇到复杂推理,再把脱敏后的内容交给云端模型。这样不是退而求其次,而是让每种工具站在合适的位置上。

如何验证部署成功

最后给自己做一个三步验收:第一,断开网络后打开终端执行 ollama run qwen2.5:7b,能回答问题;第二,用 curl http://localhost:11434/api/tags 能看到模型列表;第三,在 LM Studio 中加载同一类 GGUF 模型,输入一段 500 字中文材料,让它总结为 5 条要点,观察是否在 10-30 秒内稳定输出。三项都通过,你的本地 AI 工作台就算真正搭起来了。

如果你希望继续整理 AI 工具使用路径,睿盈工具也会把这类免费、官方、DIY 优先的实践笔记放在 wizzegroup.com;但今晚,最重要的不是入口,而是你已经把一盏小灯,安在了自己的电脑里。

⬅ 上一篇AI辅助写论文如何不越界:从选题、润色到引用核查的学术诚信流程 下一篇 ➡Midjourney新手夜航:用参数、参考图和种子值稳定画出想要的风格

🎯 猜你喜欢

本地部署本地大模型 Ollama 与 LM Studio 部署教程:从下载安装本地部署本地大模型Ollama与LM Studio部署教程:从下载安装到可用的本地部署本地大模型Ollama与LM Studio部署教程:一台普通电脑也能跑本地部署本地大模型Ollama与LM Studio部署教程:离线跑起来、跑稳、本地部署本地大模型Ollama与LM Studio部署教程:把AI装进电脑里,本地部署旧电脑也能跑AI:Ollama与LM Studio本地部署、模型选择和本地部署深夜电波:私语AI,用Ollama与LM Studio点亮你的本地智慧本地部署本地大模型Ollama与LM Studio部署教程:从下载安装到离线可

🏷️ 热门标签

Claude怎么用Claude免费使用Claude注册方法Gemini API怎么用Gemini API教程Gemini API开发入门AI生产力工具Midjourney怎么用Google翻译怎么用ChatGPT怎么用DeepL下载Midjourney教程文字转语音工具推荐GPT-4o怎么用Claude长文本分析Cursor下载LM Studio教程ChatGPT提示词工程GPT-4o教程Ollama下载
延伸阅读