什么是 Ollama?
告别手动到处找权重、写复杂脚本和配置驱动的痛苦,像用 Docker 一样敲一行命令 ollama run qwen2.5 就能在本地秒跑大模型——最受开发者喜爱的本地 AI 枢纽!
去 Hugging Face 搜模型 ➔ 选量化版本下载 ➔ 安装 C++ 编译环境或 Python 脚本 ➔ 自己写 Prompt 模板和参数拼接 ➔ 启动 API 端口 ➔ 换模型时显存无法自动释放。每一步都充满配置摩擦。
Get up and running with large language models.
把模型封装为类似 Docker 镜像的 Modelfile。一行 ollama run 自动下载、装载显卡、挂载 System Prompt 并开启 OpenAI 兼容的本地 API (11434端口),闲置 5 分钟自动卸载显存!
Ollama 颠覆本地 AI 体验的三大支柱
把复杂的底层工程封装为丝滑的开发者体验
1. 镜像化打包 (Modelfile)
深度致敬 Dockerfile。你可以用几行文本声明基础模型(FROM)、温度参数(PARAMETER temperature 0.7)、系统角色设定(SYSTEM)和对话模板(TEMPLATE),一键 ollama create 制作私有定制智能体。
2. 标准 API 与生态一统 (Port 11434)
常驻后台提供标准的 HTTP RESTful 服务,原生支持流式输出(SSE)、Embeddings 向量提取与 OpenAI /v1/chat/completions 规范。无论是 OpenClaw、Open WebUI、Dify 还是 VS Code Continue 插件,秒连即用!
3. 智能生命周期与显存按需管理
显存极其宝贵。当你发起请求时,Ollama 自动将模型装入 GPU 显存;请求结束默认保持 5 分钟热待命,若无新请求则自动将显存全部归还操作系统,彻底杜绝后台显存泄露!
📜 像写 Dockerfile 一样定制大模型:Modelfile 解剖
只需一个简单的文件,就能把通用的基础大模型调教为专属领域的专业 AI 助手:
PARAMETER top_p 0.9
你是一位资深的 Linux 运维专家与代码架构师。
回答必须言简意赅,只给出最可靠的终端命令。
"""
• 瞬间生成一个名为 my-devops-bot 的本地专属模型!
• 支持随时 ollama push 分享给团队或社区,像拉取容器镜像一样随处运行。
🎮 交互模拟器:Ollama 常用核心 CLI 与 API 演练
点击不同典型使用场景,观察终端命令与其在后台执行的自动化调度流程:
深入理解:Ollama 的生态连接力
从单机开发者玩具到全场景 AI 基础设施
OpenAI 规范零缝隙接入
自带 http://localhost:11434/v1 路由,任何支持 OpenAI 格式的开源客户端或 Agent 框架(如 OpenClaw),只需把 Base URL 指向本地,瞬间完成私有化脱机替换。
Ollama Library 官方精选 Hub
提供类似 Docker Hub 的官方模型仓库(ollama.com/library)。DeepSeek-R1、Llama 3、Qwen 2.5、Mistral、Phi-4 等全部经过官方精心验证与量化打包,开箱即用。
视觉大模型与 Function Calling
不仅支持纯文本模型,还全面支持 LLaVA / Qwen2-VL 多模态视觉识图,以及大模型函数调用(Tools / Function Calling),为本地智能体应用打下坚实基础。