AgentHubAgentHub
返回全部博客

怎么读一份大模型发布稿:六个数分三组看,三个地方最容易讲错

AgentHub 编辑部··14 分钟阅读·21 次阅读
怎么读一份大模型发布稿:六个数分三组看,三个地方最容易讲错

先说为什么要自己读

这三年我替读者核过不少模型发布稿,发现一个规律:转述里错的往往不是大事,而是数字。 而且错法很固定——单位换算错、比较对象错、时间归属错。

三个真实例子,都是广泛流传过的说法:

  • "DeepSeek-V3 用 557 万美元训出来。" 论文里给的是 2.788M(约 279 万)个 H800 GPU 小时。557 万是别人按每小时 2 美元折算出来的推算值,不是官方公布的总成本。它把"训练效率"这个概念偷换成了"总花费"。
  • "DeepSeek-V2 的成本是 GPT-4o 的百分之一。" 2024 年 5 月那组对比的原始口径是 GPT-4-Turbo。两代模型的定价差着数量级,换成 GPT-4o 这个结论就不成立了。
  • "《人工智能生成合成内容标识办法》2024 年就实施了。" 实际是 2025 年 3 月 7 日公布、2025 年 9 月 1 日施行。年份一错,后面所有"某政策带来了什么变化"的因果推断都失效。

所以这篇不讲某个模型好不好,讲读法。一份发布稿或技术报告,你只需要按顺序看六类数字,每类都有明确的"该问什么"。六类归成三组:能力、成本、权利。

图 1|六个数分三组:能力(参数、上下文、跑分)、成本(训练、推理)、权利(许可证、备案)
图 1|六个数分三组:能力(参数、上下文、跑分)、成本(训练、推理)、权利(许可证、备案)


第一组:能力

1. 参数量——一定要问"总参数还是激活参数"

2024 年之后,MoE(混合专家)架构让"参数量"这个词变成了两个数。国内几次重要发布的参数口径是这样的:

模型总参数每次推理激活
DeepSeek-V2(2024-05)236B21B
DeepSeek-V3 / R1(2024-12 / 2025-01)671B37B
Qwen3 旗舰(2025-04)235BA22B(激活 22B)
Kimi K2(2025-07)1T32B

这三个问题决定了这个数字对你意味着什么:

总参数决定权重体积。 你要下载、要存、要装进显存或内存的是总参数。671B 的权重在 BF16 下是 1.3TB 级别,量化到 4bit 也要几百 GB——这就是为什么"开源了"和"你跑得动"是两件事。

激活参数决定单 token 的计算量。 37B 激活意味着每个 token 只经过约 37B 参数的计算,这是 V3 能以很低价格提供 API 的架构原因。看到"总参数 671B、性能接近更大模型"这类表述时,真正支撑它的是右边那一列。

"A22B"这种写法是行规。 Qwen3 的 235B-A22B 意思是总 235B、激活 22B。以后你在模型名里看到连字符加 A 开头的数字,先按这个规则拆。

还有一个不写在名字里但必须查的:上下文并行和专家并行怎么部署。 同一个 671B 模型,用不同并行策略和量化精度,吞吐能差几倍。报告里如果只给参数量不给部署配置,那这一栏的信息量约等于零。

2. 上下文窗口——"支持"和"可用"之间隔着一条曲线

这条线在中国特别有故事:2023 年 10 月 9 日 Kimi 上线时卖点是 20 万字上下文,2024 年 3 月 21 日内测版本到了 200 万字,而 DeepSeek-V2 在 2024 年 5 月给的是 128K tokens。注意单位:万字和 K tokens 不是一回事,中文大约 1 字对应 0.6 到 1 个 token(取决于分词器),把"200 万字"直接读成"200 万 tokens"就错了约一倍。

看上下文要问三件事:

它在哪种精度下成立。 很多长上下文评测是"大海捞针"(在超长文本里塞一句话问模型记不记得),这类测试模型能全对,但真实任务要在几十万字里做推理和取舍,性能衰减出现在中段位置——这才是常见的坑。

窗口大不等于注意力够用。 窗口是"能塞进去",注意力是"塞进去之后还能不能兼顾"。这也是为什么 2025 年之后大家开始把长上下文和缓存一起谈:见 长上下文经济学:Prompt Caching 如何改变商业形态。

它决定的是架构选型,不只是价格。 窗口不够时你得做检索(RAG)或裁剪,窗口够大时你可以直接塞整个仓库。这两种方案的工程成本完全不同,所以上下文长度是个架构参数,不只是宣传参数。想深入这块看 上下文工程与 Token 预算管理。

3. 跑分——先分清它在测什么,再决定信不信

评测基准大致三类,各自的可信度和失效方式不同:

  • 知识型:MMLU、GPQA 这类多选题。优点是可比、可复现;缺点是所有选择题都能靠背题提分,而且头部模型在 2025 年前后已经把它刷到接近饱和,90 分和 92 分的差距很难说是真实能力差。
  • 任务型:SWE-bench(拿真实 GitHub issue 让模型改代码)、GAIA(需要调用工具的通用任务)、AIME(竞赛数学)。这类更接近"能不能干活",但同一名字下往往有多个子集,SWE-bench 就有不同规模和 Verified 版本,Verified 是人工筛过、题目本身可解的那一版。看到分数先问是哪个子集。
  • 偏好型:众包盲测的 Elo 排名。优点是反映真实使用感受;缺点是受题目分布、用户构成、模型命名风格影响,而且它测的是"人觉得哪个好",不等于"哪个能完成你的任务"。

污染(数据泄漏)是这一栏最大的系统性风险。 模型训练语料里混进了测试题,分数就会虚高,而且没人能完全排除。业界的应对是动态换题(LiveBench 这类持续更新的题库)、隐藏测试集、以及赛后人工核对。你作为读者能做的对应动作是:看它有没有同时报公开集和私有集,看有没有报标准差或多次采样。

这四个动作拿到任何跑分都能用:

  1. 看子集名(是 SWE-bench 还是 SWE-bench Verified,是 MMLU 还是 MMLU-Pro)。
  2. 看推理预算:允许模型多想 10 倍 token,几乎所有分数都会涨。报告要是不说思考预算,跑分就没有可比性。
  3. 看是不是自报。厂商自己跑的数、复现别人跑的数、第三方榜单,可信度依次上升。
  4. 看有没有跟一个具体对手比。只给自己分数不给基线的表格,是在传递"别比较"的信号。

评测标准本身怎么演进的,站内有一篇更系统的:如何科学评估一个 Agent 的好坏?从 MMLU 到 GAIA 与 AgentBench。

顺手用这套办法拆一个真实例子:站内那篇 7B 干翻闭源旗舰:Qwen-Image-2.1 开源 里的"登顶开源榜",按上面四问就能落到具体口径——哪个榜单(自建基准还是第三方)、什么规模的模型参与比较、分数差距多少、是不是官方自报。标题里的"7B"和"闭源旗舰"分别对应了参数量和比较对象这两栏,这就是一个可核查的说法。


第二组:成本

4. 训练成本——GPU 小时和美元不是一个东西

回到开头那个错例。训练成本的诚实写法是 GPU 小时数,因为它是物理量:用了多少卡、跑多久,乘起来就是卡时。DeepSeek-V3 论文给的就是 2.788M H800 GPU 小时。

一旦换算成美元,就至少混进三个假设:卡按什么价租(自持还是云上按小时)、电力和网络算不算进去、有没有把研发人力和失败实验算进去。按 2 美元/小时折算是其中一种假设,换成 4 美元/小时结论直接翻倍。

所以看到"某模型训练只花了 X 万美元",第一反应应该是:X 是谁算的、按什么单价、含不含人力。 同理,"用了多少张卡"和"用了多少卡时"也是两个数,只给前者的报道基本都不完整。

5. 推理成本——输入和输出必须分开看

API 定价这三年是中国卷得最狠的一栏,看懂它只需要三个动作。

动作一:把单位统一到"元/百万 tokens"。 站内和媒体混用三种单位:元/千 tokens、美元/百万 tokens、元/百万 tokens。2024 年 5 月那波降价里,豆包主力模型报到 0.0008 元/千 tokens,阿里云把 Qwen-Long 从 0.02 元/千 tokens 降到 0.0005 元(官方口径最高降幅 97%),同期百度把部分文心模型免费开放——这三家说的是同一件事,但单位不一样,不换算就没法比。

动作二:输入和输出分开算。 DeepSeek-V2 当时的定价是输入 1 元/百万 tokens、输出 2 元。输出比输入贵是常态,因为解码是自回归逐 token 生成,而预填充可以并行。你的实际成本取决于输入输出比:做长文档摘要(进 10 万字出 500 字)和做代码生成(进 2 千字出 2 千字)的成本结构完全相反。只报"每百万 tokens 多少钱"的对比,对这两类业务都是误导。

动作三:问有没有缓存价和批处理价。 命中缓存的输入通常按一两折计,异步批处理另有一档。真实账单里这些折扣项比标价重要得多。

这条线最终卷到了全球:2025 年 4 月 24 日智谱把 GLM-4-Plus 从 50 元/百万 tokens 降到 5 元(降幅九成),2026 年 9 月 22 日深夜 OpenAI 与 Anthropic 在 90 分钟内先后把 API 价格永久下调(过程见 凌晨 90 分钟的价格战)。想直接落地省钱的配置方法看 把 AI 账单砍掉 90%:本地部署 DeepSeek + 免费开源 Agent 工作流。


第三组:权利

这一组最容易被技术读者跳过,但它决定了三年后这个模型你还在不在用。

6. 许可证——四个条款要逐字看

中国开源模型的许可路径,本身就是这三年最重要的一条线:

  • 2023 年 6 到 7 月智谱开源 ChatGLM-6B,7 月 15 日才改成免费商用——先开源、后放开商用,这两步是分开的。
  • 2023 年 8 月 3 日阿里开源 Qwen-7B,用自定义许可(海外参照是 7 月 18 日的 Llama 2,同样是自定义社区许可)。
  • 2024 年 5 月 7 日 DeepSeek-V2 开源,自定义协议,不是 MIT。
  • 2025 年 1 月 20 日 DeepSeek-R1 直接上 MIT,App、API、权重同时开放。
  • 2025 年 4 月 29 日 Qwen3 一次放 8 款,Apache 2.0。
  • 2025 年 7 月 11 日 Kimi K2 开源,改进版 MIT。
  • 2026 年 8 到 9 月华为 openPangu-2.0:先放 5050 亿参数权重,随后连预训练、SFT、后训练强化学习的代码一起开源。

看许可证只看四件事:

  1. 商用有没有门槛。 部分自定义许可按用户量或月活设线,超过要另外授权。
  2. 衍生模型要不要用同一条款。 这是"传染性条款",会直接影响你微调后的模型能不能自由发布。
  3. 商标和署名要求。 改权重后能不能叫原名、要不要保留声明。
  4. 有没有使用政策附加限制。 有些许可正文之外还挂一份可接受使用政策,违反会撤回收。

MIT 和 Apache 2.0 的区别主要是后者带明确的专利授权条款。在商业产品里长期依赖一个模型,Apache 2.0 和 MIT 的确定性明显高于任何自定义协议——这不是偏好,是条款长度和解释空间的差别。R1 那次"App、API、权重同开 + MIT"为什么影响那么大,可以看 DeepSeek-R1 与 V3 对 Agent 生态的影响。协议和生成代码版权归属的关系,可以看 AI 时代开源协议与知识产权探讨。

7. 准入——中国特有的那一栏,别当噪音

在中国,一个模型能不能进你的生产系统,除了能力和价格,还有一道公开可查的门槛:生成式人工智能服务备案。 这条线三年走得很清楚:2023 年 8 月底首批 8 款,2024 年 4 月 117 款,2024 年底 302 款(另有 105 款境外服务完成登记),2025 年 8 月底 538 款,2026 年 6 月底 988 款,2026 年 9 月 14 日公告累计 1112 款。

读发布稿时这一栏要问三个问题:这个服务在不在备案名单里(面向国内用户提供就有影响)、境外模型是通过什么形态提供的("境外登记"这一项的存在说明监管看的是服务在哪被使用,不是模型在哪训练)、生成内容怎么标识(《人工智能生成合成内容标识办法》2025 年 9 月 1 日施行,显式与隐式标识是产品要求,不是可选项)。

把这三问当成选型清单里的硬性项,能帮你避开后面返工。


十分钟检查清单

拿到任何一份模型发布稿,按这十二问扫一遍,就能过滤掉绝大部分讲错的数字。

能力

  1. 总参数和激活参数分别是多少?量化后权重要多大?
  2. 上下文单位是 tokens 还是字?有没有报长文本中段衰减?
  3. 跑分是哪个子集?推理预算多少?是自报还是第三方?

成本 4. 训练成本给的是卡时还是美元?谁折算的、按什么单价? 5. 输入价和输出价分别是多少?有没有缓存价? 6. 单位统一到元/百万 tokens 之后,跟你现在用的模型差几倍?

权利 7. 许可证是 MIT、Apache 2.0 还是自定义?有没有用户量门槛? 8. 微调后的衍生模型能不能自由发布? 9. 权重、代码、训练数据三样各开到什么程度? 10. 面向国内提供需不需要备案?现在在不在名单里? 11. 生成内容标识怎么落地? 12. 如果这个模型明天停服,你能不能自己把它跑起来?

第 12 问最狠,也最能说明前面十一问为什么重要:只有权重、许可、部署知识三样都在手里的模型,才真的算你的。


三个错例的通用规律

回到开头那三个错法,它们对应三条通用检查:

单位换算错。 卡时→美元、千 tokens→百万 tokens、万字→K tokens。凡看到换算过的数字,自己再算一遍;凡是原文没有的量(比如"总训练花费"),标注为推算。

比较对象错。 "比谁便宜 99%""超过谁"这类结论,正确性完全取决于对手是谁、对手哪一代。看到比较先找基准模型的具体版本名,找不到就当作没有结论。

时间归属错。 政策、开源、降价这三类事件最容易被挪年份。可靠做法是只认原始公告的发布日期,比如备案数只认网信办各期公告,降价只认厂商自己的调价通知。

这三条不只是读模型发布稿有用——所有 AI 新闻都适用。想看看这条方法用在一段真实历史上,可以对照读 中国大模型三年:从 8 款备案到 1112 款,那篇里每个日期和数字都是按这套办法筛过的。


用完这套读法,接着做什么

这套方法本身不产生选型结论,它只是让你能信任自己拿到的数字。按它把六栏填完之后,站内的横向对比可以直接接着用:国产路线看 国产大模型横评:DeepSeek、通义千问、豆包、Kimi、智谱 GLM 怎么选,海外路线的成本配置看 海外大模型横评:GPT、Claude、Gemini、Llama 路线怎么配才划算,写代码场景另有一份 国内 AI 编程助手横评。

再往前一步,如果你想知道这些数字在真实历史里是怎么变动的——降价为什么集中在 2024 年 5 月、MIT 许可为什么到 2025 年才出现——上面提到的那篇三年简史里,每个日期和数字都是按同一套口径筛过的;更长的背景在 从图灵到智能体:人工智能 76 年兴衰史。

一句话版本

读一份大模型发布稿,只需要按能力(参数、上下文、跑分)、成本(训练、推理)、权利(许可证、备案)六栏各问一句"口径是什么";所有被讲错的数字,都错在单位、比较对象和时间这三处。

推荐阅读

实战教程

AI 为什么聊着聊着就忘了你说的话:它没有“记住”这一步,只有“这次递进去多少”

它不是记住了又忘掉。模型没有“记住”这个动作:你每问一次,程序都要把这次要它看的东西整份重新递一遍,而这一块地方有边界、单位是 token 不是字、还要和它的回答共用同一份预算。这篇用官方文档和有出处的研究讲清三件事:规格页上的数字该怎么读、装不下时各家怎么处理(截断还是摘要)、以及为什么装得下它照样会看漏——中间那段最容易漏,把要求拆成多轮说六类任务平均降 39%。最后给六个你当场就能用的动作,附可直接抄的话术。

实战教程

AI 为什么会一本正经地胡说八道:它认得出自己的错,却不会主动说

模型不是在查资料,是在接话——这一句能解释所有现象。这篇用四条有出处的事实讲清它为什么编得这么像:GPT-4 报告自陈不可靠、2023 年那项研究发现它能识别自己 87% 的错误、2026 年《自然》论文指出只按准确率打分等于奖励瞎猜、以及 2025 年一年里 146,932 条不存在的引文进入学术库。再给出六种你在对话框里就能做的自查,附可直接抄的话术。

实战教程

每百万 tokens 到底是多少字:三步算清一次 AI 调用要花多少钱

先把元/千 tokens、元/百万 tokens、万字这三种单位钉死,再按标定、算单次、核账单三步走:用自己的素材测字 token 比,把系统提示、本轮内容、历史轮次、工具定义四块输入加总,最后换算成每业务单位多少钱。附一个可复算的例子,和 Agent 场景下输入按 n(n+1)/2 平方增长的解释。

实战教程

在 iPhone 上怎么使用 Meta Muse?美区账号、外网与支付实操指南

Meta Muse 仅面向美区开放:iPhone 使用需要美区 Apple ID、稳定的美国网络出口和海外支付(不支持银联)。本文含下载安装、订阅避坑、社交账号接管与批量换头像实测,附邀请码领 10 亿词元福利。

探索更多生产力神器

不想只停留在理论?立即体验下一代 AI 工具与 MCP 插件

收录 ChatGPT 6、Claude 3.7、Devin 等热门 AI,以及 3000+ 开发者开源 MCP 插件与一键安装脚本。