Blog
Explore tutorials, architecture deep-dives, and best practices for AI Agents and MCP Servers.
Gemini 4 登场了:输出 100 万 token、幻觉率降到 15.1%,但你现在还用不上
9 月 30 日谷歌发布 Gemini 4 这一代的首款旗舰 Argon:单次输出上限 100 万 token、每百万 tokens 输入 2 美元、主打能连续干几小时的长流程任务,距上一条旗舰线隔了 10 个多月。但它第一批只向网络安全防御机构开放,公众可用时间谷歌没有公布。这篇把发布稿里的数字翻译成人话:为什么媒体给出的“领先 12 项 / 13 项 / 14 项”都不一样、它在从零建项目和终端操作两项上落后约 10 个百分点、独立评测里幻觉率 15.1% 很好看但知识答对率只有 49.9%(两个数必须一起看),以及普通人现在该做的三个动作。
AI 为什么聊着聊着就忘了你说的话:它没有“记住”这一步,只有“这次递进去多少”
它不是记住了又忘掉。模型没有“记住”这个动作:你每问一次,程序都要把这次要它看的东西整份重新递一遍,而这一块地方有边界、单位是 token 不是字、还要和它的回答共用同一份预算。这篇用官方文档和有出处的研究讲清三件事:规格页上的数字该怎么读、装不下时各家怎么处理(截断还是摘要)、以及为什么装得下它照样会看漏——中间那段最容易漏,把要求拆成多轮说六类任务平均降 39%。最后给六个你当场就能用的动作,附可直接抄的话术。
AI 为什么会一本正经地胡说八道:它认得出自己的错,却不会主动说
模型不是在查资料,是在接话——这一句能解释所有现象。这篇用四条有出处的事实讲清它为什么编得这么像:GPT-4 报告自陈不可靠、2023 年那项研究发现它能识别自己 87% 的错误、2026 年《自然》论文指出只按准确率打分等于奖励瞎猜、以及 2025 年一年里 146,932 条不存在的引文进入学术库。再给出六种你在对话框里就能做的自查,附可直接抄的话术。
MCP 简史:675 天换过五版规范,从 6 个示例服务器到 247 家机构
2024 年 11 月 25 日,Anthropic 用六个示例服务器和一个桌面客户端发布 MCP;到今天 675 天,它换过五版规范、SDK 累计下载破 10 亿、协议本身交给 247 家机构参与的中立基金会。这篇按版本把每一步改了什么、为什么改、竞品何时进场、鉴权与安全怎么补课一次讲清,并给出五条能直接用在选型上的判断。
每百万 tokens 到底是多少字:三步算清一次 AI 调用要花多少钱
先把元/千 tokens、元/百万 tokens、万字这三种单位钉死,再按标定、算单次、核账单三步走:用自己的素材测字 token 比,把系统提示、本轮内容、历史轮次、工具定义四块输入加总,最后换算成每业务单位多少钱。附一个可复算的例子,和 Agent 场景下输入按 n(n+1)/2 平方增长的解释。
怎么读一份大模型发布稿:六个数分三组看,三个地方最容易讲错
参数量要分清总参数和激活参数,上下文要换算单位,跑分要看子集和推理预算,训练成本只认卡时,推理价要输入输出分列,许可证和备案决定三年后它还在不在。这套读法配三个真实错例:557 万美元是推算值、DeepSeek-V2 比的是 GPT-4-Turbo、内容标识办法不在 2024 年。
中国大模型三年:从 8 款备案到 1112 款,从发布会竞赛到港交所敲钟
2023 到 2026,中国大模型走了三条线:备案数从 8 涨到 1112,API 价格从"没人报价"打到永久砍半,开源许可从自定义条款走到 MIT 与 Apache 2.0,最后智谱和 MiniMax 在 2026 年 1 月前后脚上市。这篇按四年时间顺序,只写能查到公开出处的节点。
12 个真正好用的提示词:把要求写成验收标准
从站内 1,018 条提示词里挑出 12 条覆盖开发、汇报、数据、决策与自动化的实用模板,逐条给出正文、适用场景和它有效的原因,并说明三类最常见的失效与修法。
设计师该装的 5 个 Skill:把设计标准写成说明书
我们逐个读完上游仓库里 SKILL.md 的原文,从设计向候选里留下 5 个真的写了可执行标准的:Anthropic 官方的 frontend-design 管视觉方向与排版、theme-factory 管配色与字体主题、canvas-design 先写设计哲学再出海报,加上 ui-ux-pro-max 的本地设计资料库和 popular-web-designs 的 54 套真实设计系统。附安装命令、五步组合工作流与踩坑提醒。
让 AI 替你办事的安全清单:授权怎么给、钱怎么管、出事怎么办
把邮箱、网盘甚至支付入口交给 AI 之后,风险从“它说错话”变成“它办错事”。这份清单按事前、事中、事后三段展开:授权分只读/待确认/执行三层给,账号与插件要可牺牲,支付走限额的一次性虚拟卡而不是主账户;再给出四个跑偏信号和三分钟事后检查。
Meta Muse 初体验:把一件事交给它之后,会发生什么?
Muse 把交互终点从“一段回答”变成“一件事办完”:邮件归类、比价、订行程这类简单明确的任务它接得很稳,跨站登录、支付和多步骤流程却频繁卡住。本文按任务类型梳理它接得住什么、会在哪儿掉链子、安全与生态反制的真实边界,并给出第一次派活的判断标准。
在 iPhone 上怎么使用 Meta Muse?美区账号、外网与支付实操指南
Meta Muse 仅面向美区开放:iPhone 使用需要美区 Apple ID、稳定的美国网络出口和海外支付(不支持银联)。本文含下载安装、订阅避坑、社交账号接管与批量换头像实测,附邀请码领 10 亿词元福利。