三年,三个数字
如果只能留下三个数字来记住中国大模型的这三年,我会选这三个:
8 → 1112。 2023 年 8 月底,按国家网信办公布的口径,完成生成式人工智能服务备案的产品是 8 款;到 2026 年 9 月 14 日那一期公告,累计备案数已经是 1112 款。中间经过 117(2024 年 4 月)、302(2024 年底)、538(2025 年 8 月底)、988(2026 年 6 月底)几个节点。
1 元/百万 tokens → 永久砍半。 2024 年 5 月 7 日 DeepSeek-V2 开源时,API 定价是输入 1 元/百万 tokens、输出 2 元,媒体拿它跟 GPT-4-Turbo 比,得出"近百分之一"。三年后的价格战已经不是国内厂商之间的事:2026 年 9 月 22 日深夜,OpenAI 和 Anthropic 在 90 分钟内先后动手,把 API 价格永久下调。
0 → 2。 2023 年,中国没有一家大模型公司在证券交易所上市。2026 年 1 月 8 日智谱在港交所挂牌,1 月 9 日 MiniMax 挂牌,两家加起来不到一周市值合计约 1764 亿港元。
这三个数字讲的是同一件事:这三年真正变化的不是"模型变强了多少",而是"这项能力归谁所有"。 它从几家公司手里的封闭 API,变成任何人都能下载、能改、能商用、能拿去找投资人的东西。下面按四年时间走一遍,每一段只写能核实到公开出处的节点。
2023:抢一张入场券
起点在 2022 年 11 月 30 日,ChatGPT 上线。五个月后,2023 年 3 月 14 日 GPT-4 发布——这两件事定义了此后所有国内发布会有多急。
国内的第一声是 3 月 16 日的文心一言发布会。要注意它的实际状态:邀请测试,不是所有人能用。 后面紧跟着的一串发布会都差不多:4 月 11 日通义千问在阿里云峰会上亮相(阿里宣布自家全系产品接入),5 月 6 日讯飞星火,7 月 7 日华为云盘古 3.0,9 月 7 日腾讯混元。整个上半年,各家比的其实是"谁先把发布会开掉",产品本身还在灰度里。
真正被反复引用为"百模大战"证据的是数量。2023 年 9 月前后业界统计约 130 个大模型,到 10 月已经有约 238 个。这个数字当时被用来批评行业泡沫,回头看它更像是一个入场名单。
这一年有三件事比发布会重要得多。
第一件是规则落地。 2023 年 7 月 13 日,七部门公布《生成式人工智能服务管理暂行办法》,8 月 15 日施行。在此之前,"做一个能对外提供的大模型产品"在合规上是一个模糊地带;在此之后,它变成了一个有明确前置条件的动作。8 月底首批 8 款产品完成备案,随后从邀请测试转为向所有人开放——这一步把"模型能力"变成了"可以上线的公共服务",也是后面 1112 这个数字的起点。9 月 13 日通义千问全面开放,属于同一批动作。
第二件是开源。 6 到 7 月智谱开源 ChatGLM-6B,7 月 15 日改成免费商用;8 月 3 日阿里开源 Qwen-7B。海外参照是 7 月 18 日的 Llama 2,用的也是自定义社区许可。当时几乎没人把这当成大事,因为它权重小、跑分也不亮眼。但它决定了三年后的形态:权重一旦可以被下载,能力的扩散速度就跟模型公司的发布节奏无关了。
第三件是算力被掐住。 2023 年 10 月 17 日美国升级出口管制,此前作为"合规特供"的 A800、H800 一并纳入禁运。这个节点在 2023 年看起来只是采购麻烦,到 2025、2026 年才显出它的分量——它把"国产卡能不能训大模型"从工程问题推成了产业战略问题。
这一年还剩一个值得单独立出来的产品:2023 年 10 月 9 日上线的 Kimi,卖点是 20 万字上下文。它是这三年第一个靠"能力差异"而不是"发布会"拿到增长的中国 AI 产品,也是下一年长上下文竞赛的引信。
2024:把能力标上价格
2024 年的关键词只有一个字:降价。
但降价不是营销,它是三件事同时到位的结果:MoE 稀疏激活把单次推理的计算量砍下来,开源权重把自建推理的成本摊薄,备案名单把"能不能对外卖 API"这个问题彻底解决掉。三件事缺一件,价格战都打不起来。
时间线大致是这样:
- 2 月 4 日,Qwen1.5 开源。
- 3 月 21 日,Kimi 的 200 万字上下文进入内测。长上下文从"一个产品的卖点"变成"所有人都要跟的功能"。
- 4 月前后,网信办公布的备案口径到了 117 个大模型。
- 5 月 7 日,DeepSeek-V2 发布并开源:总参数 236B、激活 21B,支持 128K 上下文,API 定价输入 1 元/百万 tokens、输出 2 元。当时最出圈的说法是"成本约为 GPT-4-Turbo 的百分之一"(注意比较对象是 GPT-4-Turbo,不是 GPT-4o)。许可证是自定义协议,不是 MIT。
- 5 月中旬的火山引擎 FORCE 原动力大会上,字节把豆包主力模型定价压到 0.0008 元/千 tokens,宣称比行业低 99.3%,并披露豆包大模型日均 tokens 消耗已达 1200 亿级别。
- 5 月 21 日,阿里云宣布降价,最高降幅 97%,通义千问长期限的 Qwen-Long 从 0.02 元/千 tokens 降到 0.0005 元。同期百度把部分文心模型免费开放。
- 6 月 4 日前后智谱开源 GLM-4-9B;6 月 7 日 Qwen2 发布;9 月 19 日 Qwen2.5 发布,这一代后来成为开源微调生态最依赖的基座之一。
- 12 月 27 日,DeepSeek-V3 发布:总参数 671B、激活 37B。
有两个细节值得单独说,因为它们在传播中被反复讲错。
一是 V3 的训练成本。论文里给出的是 2.788M(约 279 万)个 H800 GPU 小时,被广泛引用的"557 万美元"是按每小时 2 美元折算出来的推算值,不是官方公布的总训练成本。三年过去,这个数字仍然经常被当成"国产模型训练极便宜"的证据引用,严格说并不准确。
二是内容标识规则的时间。《人工智能生成合成内容标识办法》是 2025 年 3 月 7 日公布、2025 年 9 月 1 日施行,不属于 2024 年。把它放进 2024 是常见的整理错误。
这一年年底的备案口径是:截至 2024 年 12 月 31 日累计 302 款完成备案,另有 105 款已上线但未备案的境外服务完成登记(公告发布于 2025 年 1 月 8 日)。"境外登记"这一项很关键,它说明监管的边界已经不只看模型在哪训练,而是看服务在哪被使用。
另外,2024 年 11 月 25 日 Anthropic 发布了 MCP 协议。它在 2024 年几乎没有掀起讨论,但它是第三幕的主角。
2025:开源权重,和模型开始能动手
如果要给这三年挑一个转折年,我选 2025。两件事在这一年同时发生:权重的自由度和模型的能力,第一次撞在了一起。
- 1 月 13 日,美国商务部产业安全局(BIS)的《AI 扩散规则》定稿,把算力芯片的出口按国家和层级做了配额化安排。
- 1 月 20 日,DeepSeek-R1 发布:671B 总参、37B 激活,MIT 许可,App、API、权重同时开放。MIT 意味着几乎无附加条件的商用自由,这在之前一年的中国开源模型里是不常见的(DeepSeek 自己的 V2 用的是自定义许可)。
- 1 月 27 日,英伟达单日收跌 16.97%,市值蒸发约 5890 亿美元。 一个开源模型的发布日让全球市值最高的公司之一抹掉了这个数目的市值,这件事本身就是权力转移的证据。
- 2 月,多地政务系统接入 DeepSeek 本地化部署;2 月 28 日前后二十余家车企宣布模型融合。开源权重从开发者的玩具变成了政府和制造业的采购选项。
- 4 月 15 日,H20 被要求逐案申请许可。"买不到"从传闻成了流程。
- 4 月 24 日,智谱把 GLM-4-Plus 降价九成,从 50 元/百万 tokens 降到 5 元。注意这一年真正的大幅降价发生在 4 月,不是很多人记忆里的 2024 年。
- 4 月 29 日,Qwen3 开源:一次放出 8 款,旗舰 235B-A22B,引入混合思考模式,Apache 2.0 许可。
- 5 月 28 日,R1-0528 版本发布。
- 7 月 11 日,Kimi K2 开源:1T 参数 MoE、32B 激活,采用改进版 MIT 许可,发布后登上 Hugging Face 热榜。7 月 26 到 28 日是 WAIC 2025,7 月 28 日智谱发布 GLM-4.5。
- 8 月 31 日这一期公告里,累计备案数到 538 款。
- 9 月 18 日,华为在全联接大会公布昇腾三年路线图:910C 已出货,Atlas 950 超节点排在 2026 年四季度。"用国产卡训练大模型"从口号变成了有明确时间表的工程计划。
- 全年新增 446 款服务完成备案(此数字来自 2026 年 1 月 9 日网信办的通报)。
MCP 这条线也在这一年接上了:2025 年 3 月 26 日 OpenAI 的 Agents SDK 支持 MCP,4 月 10 日 Google Gemini 支持,9 月 29 日 DeepSeek 的 API 支持 MCP。 从 2024 年 11 月协议发布到三家头部模型都认,用了不到一年。
这件事对普通使用者的意义比任何跑分都直接:模型从"回答问题的东西"变成"能操作工具的东西"。 你给它一个能读仓库、能查数据库、能改文件的接口,它就能替你干活。想理解这条线,可以看我们那篇 MCP 到底是什么,以及更早的 DeepSeek-R1 与 V3 对 Agent 生态的影响。
2026:变成产业,走出去,也把底座换掉
2026 年的前两个月定掉了这一年的调子。
- 1 月 8 日,智谱在港交所挂牌:发行 3741.95 万股 H 股,定价 116.2 港元/股,首日涨超 13%,市值约 698 亿港元,被称作"全球大模型第一股"。
- 1 月 9 日,MiniMax 挂牌:首日涨 109%,市值约 1066 亿港元,基石投资者合计认购 27.23 亿港元。到 1 月 12 日,两家合计市值约 1764 亿港元。
上市带来的不只有市值。它把"模型公司"变成了一类可以被公开定价、被财报约束、被指数纳入的资产——也从这一刻开始要接受股价的检验:6 月 6 日纳入恒生科技指数前的最后一个交易日,MiniMax 一度跌超 17%,智谱跌超 10%。
第二件事是出海。
- 8 月 9 到 10 日,华为开源 openPangu-2.0 的 5050 亿参数权重,并强调全程不使用英伟达、在国产卡上完成训练;9 月 28 日进一步开源了预训练、SFT 与后训练强化学习的代码。三年前"国产卡能不能训大模型"还是个疑问句,这一年它有了可复现的答案。
- 8 月下旬起,多家媒体引用 Hugging Face 的统计口径报道称,中国开源模型的下载占比达到约 41%,首次超过美国(半年前这个比例还在 17% 左右)。同期还有报道称中国模型在海外服务中充当底座,比如沙特一些项目采用 MiniMax 作为底层模型。
- 8 月 28 日,有报道称英伟达拟以约 129 亿美元收购 Hugging Face。无论交易最终如何,"全球最大开源社区可能被一家美国芯片公司买下"这个可能性本身,就说明了这个社区现在有多重要。
- 7 月 17 到 20 日的 WAIC 2026 提供了一个规模侧的证据:外交部、国家发改委等十个部门联合上海市政府主办,近 140 场论坛、1400 余位嘉宾,展览面积超过 10 万平方米,1100 余家企业、3000 余项展品、超过 300 款全球首发,57 个核心场景,162 亿元意向合作金额。它已经不是产品展,更像产业例会。
第三件事是价格战换了战场。9 月 21 日 Qwen-Image-2.1 以 7B 规模开源并登顶开源图像榜;9 月 22 日深夜,OpenAI 与 Anthropic 在 90 分钟内先后动作,把 API 价格永久下调。价格战从"国内厂商互相抢客户"变成了"全球厂商都被迫回应中国开源模型的成本曲线"。到 9 月 14 日那期公告,累计备案数 1112 款(7、8 两月新增 124 款)。
把四年叠在一起,能看见三条曲线
单看任何一年都像运气;把四年叠起来看,是同三件事在同时移动。
第一条:许可证曲线。 2023 年是闭源 API 加少量小模型开源(ChatGLM-6B 在 7 月才转免费商用,Qwen-7B 用自定义许可);2024 年 DeepSeek-V2、Qwen2 系列仍以自定义条款为主;2025 年 R1 直接上 MIT、Qwen3 上 Apache 2.0、Kimi K2 上改进 MIT;2026 年 openPangu 连训练代码一起放出来。商用自由度每放开一档,能被拿去做产品的人就多一个数量级。 这条线比跑分线更能解释为什么中国模型在海外被大量下载。
第二条:价格曲线。 2023 年几乎没人公布 token 单价;2024 年 5 月一个月内三家连续降价,阿里最高降 97%;2025 年 4 月智谱降九成;2026 年 9 月轮到 OpenAI 和 Anthropic 永久降价。单位能力价格降到接近免费时,竞争重心必然从"能不能用"移到"用得值不值"——这就是 2025 年之后 Agent、工作流、上下文工程成为主题的原因。想直接省钱落地,可以看 把 AI 账单砍掉 90% 和 长上下文经济学。
第三条:备案曲线。 8 → 117 → 302 → 538 → 988 → 1112。这条线经常被解读成"管制收紧",但它实际起的作用是筛掉了不能上线的玩家,同时给能上线的产品发了准入券。2023 年那 238 个模型里,绝大多数今天已经不提供公开服务;而备案数从 8 涨到 1112 的这一段,正好是"能力从发布会走向公共服务"的那一段。
三条线背后是一个共同机制:每一次扩散都不是靠单点技术突破,而是靠"能力、成本、准入"三者同时对齐。 缺任何一个,都只是一场发布会。
这段历史对你现在做选择有什么用
如果你今天正在这些模型之间做决定,四年历史给的不是情怀,是判断依据:
看许可证,不要只看跑分。 你要长期依赖的模型,它的权重和条款决定了三年后它还在不在、你能不能自建。国产模型的选型可以看 国产大模型横评:DeepSeek、通义千问、豆包、Kimi、智谱 GLM 怎么选,海外路线的成本配置看 海外大模型横评。写代码场景单独有一份 国内 AI 编程助手横评。
把"模型会不会做"和"你能不能说清要什么"分开解决。 这三年模型能力涨得极快,但决定产出质量的仍是需求描述本身。可以参考 12 个真正好用的提示词:把要求写成验收标准,以及把标准写成说明书的思路:设计师该装的 5 个 Skill。
关心协议层,因为它决定模型能伸多远。 2025 年那三次 MCP 支持,比同年的任何一次版本更新都更持久地改变了产品形态。
如果你更喜欢用图表看这条线,可以把 人工智能 76 年兴衰史 和 AI 时间线交互图表 一起看——前者把 2023 到 2026 放回了更长的历史里,后者能拖动缩放,把每一次涨跌摆在同一条坐标轴上。
还没解决的部分
诚实一点说,这三年没有解决三件事。
算力自主仍然不是一句"能训练"就结束。 2026 年 openPangu 证明了国产卡能训出可用权重的模型,但训练只是成本的一部分,推理规模、互连带宽、软件生态的成熟度是另一个问题;华为路线图排到了 2026 年四季度,说明这件事本身还没走完。
开源生态的关键基础设施可能易主。 一个被 41% 下载占比证明重要的开源社区,正在被讨论"可能被一家芯片公司收购"。开源权重是自由的,托管它的平台未必。 这是 2026 年最值得留意的一件事。
从"能干活"到"敢放手让它干"还差一段。 智能体这一年热度极高,但可靠性、权限边界、注入攻击这些工程问题一个都没消失。这也是我们把 AI 智能体安全清单 单独写出来的原因。
一句话版本
这三年中国大模型发生的最重要的事,不是某个模型超过了某个模型,而是这项能力的所有权变了:从几家公司手里的封闭 API,变成了 1112 款可以上线的服务、可以被下载 MIT 权重的开源基座、和被交易所定价的两家上市公司。 下一次同类变化发生时,它同样不会先出现在跑分表上,而会先出现在价格和许可证上。