主题
Ollama 与 LM Studio 本地 AI 入门
本地模型把推理运行在自己的电脑上,适合离线、隐私敏感和开发调试。它不是自动等于“免费又更强”:你仍要承担硬件占用、模型下载、速度和维护成本。
装好后想马上用起来?《本地知识问答实战》用这里的本地 API 做一个带引用的文档问答服务。
1. 先选 Ollama 还是 LM Studio
| 需求 | 推荐 | 原因 |
|---|---|---|
| 第一次体验本地模型、喜欢图形界面 | LM Studio | 搜索、下载、加载和聊天都可视化 |
| 需要脚本、API、服务器或终端集成 | Ollama | 命令简洁,适合自动化 |
| 想查看模型文件、量化与运行参数 | LM Studio | 界面信息更直观 |
| 想接入其他开发工具 | Ollama | 本地服务与集成路径直接 |
2. 硬件与模型大小
LM Studio 官方系统要求建议 16GB 以上内存;Windows x64 处理器需要 AVX2,并建议至少 4GB 独立显存。Ollama 支持 macOS、Windows 与 Linux,具体安装以官方快速开始为准。
新手可按这个保守规则起步:
| 可用内存 | 起步模型规模 | 建议 |
|---|---|---|
| 8GB | 1B–4B 的量化模型 | 关闭其他大应用,缩短上下文 |
| 16GB | 4B–8B 的量化模型 | 日常问答和轻量代码最合适 |
| 32GB | 8B–14B,视量化而定 | 质量更好,仍需观察占用 |
| 64GB+ 或大显存 | 更大模型 | 先确认实际任务收益再下载 |
模型参数量、量化方式、上下文长度都会影响内存,表格只是起点,不是保证。
3. 路线 A:Ollama
3.1 安装并确认服务
从 Ollama 官网下载对应系统版本。安装后运行:
bash
ollama --version
ollama新版交互菜单可以选择并运行模型。也可以按模型库页面提供的名称执行:
bash
ollama run MODEL_NAME3.2 验证本地 API
官方快速开始给出的本地 API 默认位于 http://localhost:11434。替换为你已经下载的模型名:
bash
curl http://localhost:11434/api/chat -d '{
"model": "MODEL_NAME",
"messages": [{"role": "user", "content": "只回复:本地连接成功"}],
"stream": false
}'3.3 常用管理命令
bash
ollama list
ollama ps
ollama stop MODEL_NAME
ollama rm MODEL_NAME删除前确认模型名;模型文件通常很大,下载时注意磁盘空间。
4. 路线 B:LM Studio
4.1 安装、搜索与加载
- 从 LM Studio 官网下载并启动。
- 在 Discover 中搜索模型,优先选择与内存匹配的 GGUF 量化版本。
- 下载后进入 Chat,加载模型并发送一句测试消息。
- 若内存不足,换更小参数量或更高压缩量化,不要盲目加大上下文。
4.2 启动本地 API
LM Studio 的 REST API 快速开始说明,可在 Developer 页面启动服务,也可以运行:
bash
lms server start默认地址是 http://localhost:1234。先列出模型:
bash
curl http://localhost:1234/api/v1/models默认服务可能不要求认证。只绑定本机使用,不要直接暴露到公网;需要局域网访问时启用 API Token、限制防火墙来源并确认数据政策。
5. 如何判断“真的在本地”
- 模型文件已经下载到本机。
- 推理时系统的 CPU、GPU 或统一内存占用明显上升。
- API 地址是
localhost或127.0.0.1。 - 断网后仍能对已下载模型进行对话。
- 没有启用会把内容发给外部服务的搜索、插件或 MCP 工具。
“模型本地”不代表整个工作流都本地,联网插件仍可能发送数据。
6. 常见问题
6.1 回答很慢
换更小模型或更激进的量化,缩短上下文,关闭占显存程序。首次加载慢、后续生成正常通常是模型载入时间。
6.2 程序直接退出或内存爆满
模型或上下文超出硬件能力。先从 4B–8B 量化模型开始,不要同时加载多个模型。
6.3 客户端连接不到本地 API
确认服务正在运行、端口正确、客户端需要的协议是否兼容。用 curl 先证明服务端正常,再检查客户端配置。
7. 完成标准
- [ ] 能说明本地模型的隐私边界与硬件代价。
- [ ] 已成功加载一个匹配硬件的模型。
- [ ] 断网后仍能完成一次对话。
- [ ] 能用
curl验证本地 API。 - [ ] 本地服务没有直接暴露到公网。