先说为什么要自己读
这三年我替读者核过不少模型发布稿,发现一个规律:转述里错的往往不是大事,而是数字。 而且错法很固定——单位换算错、比较对象错、时间归属错。
三个真实例子,都是广泛流传过的说法:
- "DeepSeek-V3 用 557 万美元训出来。" 论文里给的是 2.788M(约 279 万)个 H800 GPU 小时。557 万是别人按每小时 2 美元折算出来的推算值,不是官方公布的总成本。它把"训练效率"这个概念偷换成了"总花费"。
- "DeepSeek-V2 的成本是 GPT-4o 的百分之一。" 2024 年 5 月那组对比的原始口径是 GPT-4-Turbo。两代模型的定价差着数量级,换成 GPT-4o 这个结论就不成立了。
- "《人工智能生成合成内容标识办法》2024 年就实施了。" 实际是 2025 年 3 月 7 日公布、2025 年 9 月 1 日施行。年份一错,后面所有"某政策带来了什么变化"的因果推断都失效。
所以这篇不讲某个模型好不好,讲读法。一份发布稿或技术报告,你只需要按顺序看六类数字,每类都有明确的"该问什么"。六类归成三组:能力、成本、权利。
第一组:能力
1. 参数量——一定要问"总参数还是激活参数"
2024 年之后,MoE(混合专家)架构让"参数量"这个词变成了两个数。国内几次重要发布的参数口径是这样的:
| 模型 | 总参数 | 每次推理激活 |
|---|---|---|
| DeepSeek-V2(2024-05) | 236B | 21B |
| DeepSeek-V3 / R1(2024-12 / 2025-01) | 671B | 37B |
| Qwen3 旗舰(2025-04) | 235B | A22B(激活 22B) |
| Kimi K2(2025-07) | 1T | 32B |
这三个问题决定了这个数字对你意味着什么:
总参数决定权重体积。 你要下载、要存、要装进显存或内存的是总参数。671B 的权重在 BF16 下是 1.3TB 级别,量化到 4bit 也要几百 GB——这就是为什么"开源了"和"你跑得动"是两件事。
激活参数决定单 token 的计算量。 37B 激活意味着每个 token 只经过约 37B 参数的计算,这是 V3 能以很低价格提供 API 的架构原因。看到"总参数 671B、性能接近更大模型"这类表述时,真正支撑它的是右边那一列。
"A22B"这种写法是行规。 Qwen3 的 235B-A22B 意思是总 235B、激活 22B。以后你在模型名里看到连字符加 A 开头的数字,先按这个规则拆。
还有一个不写在名字里但必须查的:上下文并行和专家并行怎么部署。 同一个 671B 模型,用不同并行策略和量化精度,吞吐能差几倍。报告里如果只给参数量不给部署配置,那这一栏的信息量约等于零。
2. 上下文窗口——"支持"和"可用"之间隔着一条曲线
这条线在中国特别有故事:2023 年 10 月 9 日 Kimi 上线时卖点是 20 万字上下文,2024 年 3 月 21 日内测版本到了 200 万字,而 DeepSeek-V2 在 2024 年 5 月给的是 128K tokens。注意单位:万字和 K tokens 不是一回事,中文大约 1 字对应 0.6 到 1 个 token(取决于分词器),把"200 万字"直接读成"200 万 tokens"就错了约一倍。
看上下文要问三件事:
它在哪种精度下成立。 很多长上下文评测是"大海捞针"(在超长文本里塞一句话问模型记不记得),这类测试模型能全对,但真实任务要在几十万字里做推理和取舍,性能衰减出现在中段位置——这才是常见的坑。
窗口大不等于注意力够用。 窗口是"能塞进去",注意力是"塞进去之后还能不能兼顾"。这也是为什么 2025 年之后大家开始把长上下文和缓存一起谈:见 长上下文经济学:Prompt Caching 如何改变商业形态。
它决定的是架构选型,不只是价格。 窗口不够时你得做检索(RAG)或裁剪,窗口够大时你可以直接塞整个仓库。这两种方案的工程成本完全不同,所以上下文长度是个架构参数,不只是宣传参数。想深入这块看 上下文工程与 Token 预算管理。
3. 跑分——先分清它在测什么,再决定信不信
评测基准大致三类,各自的可信度和失效方式不同:
- 知识型:MMLU、GPQA 这类多选题。优点是可比、可复现;缺点是所有选择题都能靠背题提分,而且头部模型在 2025 年前后已经把它刷到接近饱和,90 分和 92 分的差距很难说是真实能力差。
- 任务型:SWE-bench(拿真实 GitHub issue 让模型改代码)、GAIA(需要调用工具的通用任务)、AIME(竞赛数学)。这类更接近"能不能干活",但同一名字下往往有多个子集,SWE-bench 就有不同规模和 Verified 版本,Verified 是人工筛过、题目本身可解的那一版。看到分数先问是哪个子集。
- 偏好型:众包盲测的 Elo 排名。优点是反映真实使用感受;缺点是受题目分布、用户构成、模型命名风格影响,而且它测的是"人觉得哪个好",不等于"哪个能完成你的任务"。
污染(数据泄漏)是这一栏最大的系统性风险。 模型训练语料里混进了测试题,分数就会虚高,而且没人能完全排除。业界的应对是动态换题(LiveBench 这类持续更新的题库)、隐藏测试集、以及赛后人工核对。你作为读者能做的对应动作是:看它有没有同时报公开集和私有集,看有没有报标准差或多次采样。
这四个动作拿到任何跑分都能用:
- 看子集名(是 SWE-bench 还是 SWE-bench Verified,是 MMLU 还是 MMLU-Pro)。
- 看推理预算:允许模型多想 10 倍 token,几乎所有分数都会涨。报告要是不说思考预算,跑分就没有可比性。
- 看是不是自报。厂商自己跑的数、复现别人跑的数、第三方榜单,可信度依次上升。
- 看有没有跟一个具体对手比。只给自己分数不给基线的表格,是在传递"别比较"的信号。
评测标准本身怎么演进的,站内有一篇更系统的:如何科学评估一个 Agent 的好坏?从 MMLU 到 GAIA 与 AgentBench。
顺手用这套办法拆一个真实例子:站内那篇 7B 干翻闭源旗舰:Qwen-Image-2.1 开源 里的"登顶开源榜",按上面四问就能落到具体口径——哪个榜单(自建基准还是第三方)、什么规模的模型参与比较、分数差距多少、是不是官方自报。标题里的"7B"和"闭源旗舰"分别对应了参数量和比较对象这两栏,这就是一个可核查的说法。
第二组:成本
4. 训练成本——GPU 小时和美元不是一个东西
回到开头那个错例。训练成本的诚实写法是 GPU 小时数,因为它是物理量:用了多少卡、跑多久,乘起来就是卡时。DeepSeek-V3 论文给的就是 2.788M H800 GPU 小时。
一旦换算成美元,就至少混进三个假设:卡按什么价租(自持还是云上按小时)、电力和网络算不算进去、有没有把研发人力和失败实验算进去。按 2 美元/小时折算是其中一种假设,换成 4 美元/小时结论直接翻倍。
所以看到"某模型训练只花了 X 万美元",第一反应应该是:X 是谁算的、按什么单价、含不含人力。 同理,"用了多少张卡"和"用了多少卡时"也是两个数,只给前者的报道基本都不完整。
5. 推理成本——输入和输出必须分开看
API 定价这三年是中国卷得最狠的一栏,看懂它只需要三个动作。
动作一:把单位统一到"元/百万 tokens"。 站内和媒体混用三种单位:元/千 tokens、美元/百万 tokens、元/百万 tokens。2024 年 5 月那波降价里,豆包主力模型报到 0.0008 元/千 tokens,阿里云把 Qwen-Long 从 0.02 元/千 tokens 降到 0.0005 元(官方口径最高降幅 97%),同期百度把部分文心模型免费开放——这三家说的是同一件事,但单位不一样,不换算就没法比。
动作二:输入和输出分开算。 DeepSeek-V2 当时的定价是输入 1 元/百万 tokens、输出 2 元。输出比输入贵是常态,因为解码是自回归逐 token 生成,而预填充可以并行。你的实际成本取决于输入输出比:做长文档摘要(进 10 万字出 500 字)和做代码生成(进 2 千字出 2 千字)的成本结构完全相反。只报"每百万 tokens 多少钱"的对比,对这两类业务都是误导。
动作三:问有没有缓存价和批处理价。 命中缓存的输入通常按一两折计,异步批处理另有一档。真实账单里这些折扣项比标价重要得多。
这条线最终卷到了全球:2025 年 4 月 24 日智谱把 GLM-4-Plus 从 50 元/百万 tokens 降到 5 元(降幅九成),2026 年 9 月 22 日深夜 OpenAI 与 Anthropic 在 90 分钟内先后把 API 价格永久下调(过程见 凌晨 90 分钟的价格战)。想直接落地省钱的配置方法看 把 AI 账单砍掉 90%:本地部署 DeepSeek + 免费开源 Agent 工作流。
第三组:权利
这一组最容易被技术读者跳过,但它决定了三年后这个模型你还在不在用。
6. 许可证——四个条款要逐字看
中国开源模型的许可路径,本身就是这三年最重要的一条线:
- 2023 年 6 到 7 月智谱开源 ChatGLM-6B,7 月 15 日才改成免费商用——先开源、后放开商用,这两步是分开的。
- 2023 年 8 月 3 日阿里开源 Qwen-7B,用自定义许可(海外参照是 7 月 18 日的 Llama 2,同样是自定义社区许可)。
- 2024 年 5 月 7 日 DeepSeek-V2 开源,自定义协议,不是 MIT。
- 2025 年 1 月 20 日 DeepSeek-R1 直接上 MIT,App、API、权重同时开放。
- 2025 年 4 月 29 日 Qwen3 一次放 8 款,Apache 2.0。
- 2025 年 7 月 11 日 Kimi K2 开源,改进版 MIT。
- 2026 年 8 到 9 月华为 openPangu-2.0:先放 5050 亿参数权重,随后连预训练、SFT、后训练强化学习的代码一起开源。
看许可证只看四件事:
- 商用有没有门槛。 部分自定义许可按用户量或月活设线,超过要另外授权。
- 衍生模型要不要用同一条款。 这是"传染性条款",会直接影响你微调后的模型能不能自由发布。
- 商标和署名要求。 改权重后能不能叫原名、要不要保留声明。
- 有没有使用政策附加限制。 有些许可正文之外还挂一份可接受使用政策,违反会撤回收。
MIT 和 Apache 2.0 的区别主要是后者带明确的专利授权条款。在商业产品里长期依赖一个模型,Apache 2.0 和 MIT 的确定性明显高于任何自定义协议——这不是偏好,是条款长度和解释空间的差别。R1 那次"App、API、权重同开 + MIT"为什么影响那么大,可以看 DeepSeek-R1 与 V3 对 Agent 生态的影响。协议和生成代码版权归属的关系,可以看 AI 时代开源协议与知识产权探讨。
7. 准入——中国特有的那一栏,别当噪音
在中国,一个模型能不能进你的生产系统,除了能力和价格,还有一道公开可查的门槛:生成式人工智能服务备案。 这条线三年走得很清楚:2023 年 8 月底首批 8 款,2024 年 4 月 117 款,2024 年底 302 款(另有 105 款境外服务完成登记),2025 年 8 月底 538 款,2026 年 6 月底 988 款,2026 年 9 月 14 日公告累计 1112 款。
读发布稿时这一栏要问三个问题:这个服务在不在备案名单里(面向国内用户提供就有影响)、境外模型是通过什么形态提供的("境外登记"这一项的存在说明监管看的是服务在哪被使用,不是模型在哪训练)、生成内容怎么标识(《人工智能生成合成内容标识办法》2025 年 9 月 1 日施行,显式与隐式标识是产品要求,不是可选项)。
把这三问当成选型清单里的硬性项,能帮你避开后面返工。
十分钟检查清单
拿到任何一份模型发布稿,按这十二问扫一遍,就能过滤掉绝大部分讲错的数字。
能力
- 总参数和激活参数分别是多少?量化后权重要多大?
- 上下文单位是 tokens 还是字?有没有报长文本中段衰减?
- 跑分是哪个子集?推理预算多少?是自报还是第三方?
成本 4. 训练成本给的是卡时还是美元?谁折算的、按什么单价? 5. 输入价和输出价分别是多少?有没有缓存价? 6. 单位统一到元/百万 tokens 之后,跟你现在用的模型差几倍?
权利 7. 许可证是 MIT、Apache 2.0 还是自定义?有没有用户量门槛? 8. 微调后的衍生模型能不能自由发布? 9. 权重、代码、训练数据三样各开到什么程度? 10. 面向国内提供需不需要备案?现在在不在名单里? 11. 生成内容标识怎么落地? 12. 如果这个模型明天停服,你能不能自己把它跑起来?
第 12 问最狠,也最能说明前面十一问为什么重要:只有权重、许可、部署知识三样都在手里的模型,才真的算你的。
三个错例的通用规律
回到开头那三个错法,它们对应三条通用检查:
单位换算错。 卡时→美元、千 tokens→百万 tokens、万字→K tokens。凡看到换算过的数字,自己再算一遍;凡是原文没有的量(比如"总训练花费"),标注为推算。
比较对象错。 "比谁便宜 99%""超过谁"这类结论,正确性完全取决于对手是谁、对手哪一代。看到比较先找基准模型的具体版本名,找不到就当作没有结论。
时间归属错。 政策、开源、降价这三类事件最容易被挪年份。可靠做法是只认原始公告的发布日期,比如备案数只认网信办各期公告,降价只认厂商自己的调价通知。
这三条不只是读模型发布稿有用——所有 AI 新闻都适用。想看看这条方法用在一段真实历史上,可以对照读 中国大模型三年:从 8 款备案到 1112 款,那篇里每个日期和数字都是按这套办法筛过的。
用完这套读法,接着做什么
这套方法本身不产生选型结论,它只是让你能信任自己拿到的数字。按它把六栏填完之后,站内的横向对比可以直接接着用:国产路线看 国产大模型横评:DeepSeek、通义千问、豆包、Kimi、智谱 GLM 怎么选,海外路线的成本配置看 海外大模型横评:GPT、Claude、Gemini、Llama 路线怎么配才划算,写代码场景另有一份 国内 AI 编程助手横评。
再往前一步,如果你想知道这些数字在真实历史里是怎么变动的——降价为什么集中在 2024 年 5 月、MIT 许可为什么到 2025 年才出现——上面提到的那篇三年简史里,每个日期和数字都是按同一套口径筛过的;更长的背景在 从图灵到智能体:人工智能 76 年兴衰史。
一句话版本
读一份大模型发布稿,只需要按能力(参数、上下文、跑分)、成本(训练、推理)、权利(许可证、备案)六栏各问一句"口径是什么";所有被讲错的数字,都错在单位、比较对象和时间这三处。