
看 GitHub 不够,看企业部署才完整
“开源 LLM 用得怎么样?”这问题答案取决于你问的是哪类受众。GitHub 看的是开发者尝试,企业内部看的是生产采纳,这两套数据在 2026 年的差距比想象中更大。把两边放一起看,才能拼出真实画面。
GitHub 这一面:头部开源模型增长放缓,新生代接棒
从 GitHub 代码量、模型下载、Hugging Face 上 Star 数量来看,几个老牌系列(Llama 2/3、Qwen 1.5/2、Mistral 第一代)增速都在放缓,但新一代系列正在补位:
- DeepSeek 系列因为官方主动跟进模型卡 + benchmark 透明度,2025-2026 拿下了大量企业 + 学术 Star;
- Qwen 系列的多模态分支(视觉、音频)进入开发者视野;
- Llama 4 因许可争议在国内几乎无人问津,反而让 Qwen / DeepSeek 在中文圈吃掉了大部分红利。
GitHub 端的现实:开发者的注意力从单一旗舰模型扩散到了”每个场景挑一个最合适的”。这是开源最健康的形态。
企业部署这一面:比想象中静悄悄
企业侧的采用率比媒体叙事高得多,也比开源布道者愿意承认的更务实。三类企业在 2026 实际部署了开源:
- 金融 / 法务 / 医疗这类数据敏感行业:用 7B-14B 开源 + 微调,主要跑本地,闭源 API 只做兜底。
- 出海 + 中文场景:用 Qwen 系列跑一半业务,DeepSeek 跑另一半,几乎不再只用 OpenAI。
- 大厂的内部平台:每个 BU 都自建一两个开源模型集群,作为内部”模型市场”的供给。
三类数据放一起看到的结论
- 采纳率不是 0/1 切换,而是混合架构:80% 的中型以上企业已经在用 2-4 个模型,1 个闭源 + 1-3 个开源,按任务路由。
- 真正卡脖子的不是模型,是工程能力:在企业落地调研里反复出现”内部没有人能跑 vLLM / TGI 推理服务”和”不知道怎么监控”。开源第一难度的瓶颈在 MLOps。
- 中国开源 LLM 在非中文市场也吃到份额:DeepSeek 靠着英文能力稳定 + 模型卡透明,在欧美的科研团队里占比明显提升。Qwen 的多模态在欧美 SDK 市场也开始有声音。
给采用者的两个提醒
- 不要只看 leaderboard。MMLU 分数差 3 个点,对企业应用往往没影响;token 成本差 40%、响应延迟差 200ms 反而决定生死。
- 把”运维”预算前置。采用开源省下的许可证费,往往会被推理基建和 7×24 监控吃掉一半。第一年算账的时候把这点算进去。
开源 LLM 不再是”小作坊的选择”,它是 2026 年大厂与企业并行的默认选项之一。但真的用起来,从来不是装上就跑,是一整套工程题。



