
「最新模型永远在云端」这条假设正在松动。对隐私、成本、延迟敏感的团队,本地 / 专有云部署开源权重,已经从实验变成默认选项之一。
什么时候该本地
- 数据不能出域(法务、医疗、内部代码)
- 高频调用导致 API 账单失控
- 需要稳定延迟、可预测吞吐
- 要对模型行为做深度定制与离线评测
工程落地要点
- 先定评测集,再选型:通用聊天榜 ≠ 你的业务榜
- 量化(GGUF / AWQ 等)换吞吐,但要回归关键任务质量
- 用 Ollama / vLLM / llama.cpp 分层:个人原型 vs 服务端吞吐
- 网关统一鉴权、限流、审计,避免「每人一个本地 API」
和云端的组合拳
常见架构是:敏感检索与草稿在本地,困难推理路由到云端前沿模型,中间用策略引擎决定。路由规则写清楚,比「永远用最强模型」更省钱,也更安全。



