AgentHubAgentHub

标签:普通用户指南

标签「普通用户指南」相关文章

Gemini 4 登场了:输出 100 万 token、幻觉率降到 15.1%,但你现在还用不上
生态前沿

Gemini 4 登场了:输出 100 万 token、幻觉率降到 15.1%,但你现在还用不上

9 月 30 日谷歌发布 Gemini 4 这一代的首款旗舰 Argon:单次输出上限 100 万 token、每百万 tokens 输入 2 美元、主打能连续干几小时的长流程任务,距上一条旗舰线隔了 10 个多月。但它第一批只向网络安全防御机构开放,公众可用时间谷歌没有公布。这篇把发布稿里的数字翻译成人话:为什么媒体给出的“领先 12 项 / 13 项 / 14 项”都不一样、它在从零建项目和终端操作两项上落后约 10 个百分点、独立评测里幻觉率 15.1% 很好看但知识答对率只有 49.9%(两个数必须一起看),以及普通人现在该做的三个动作。

AgentHub 编辑部
·13 分钟阅读
#Gemini 4#Argon#谷歌新模型
AI 为什么聊着聊着就忘了你说的话:它没有“记住”这一步,只有“这次递进去多少”
实战教程

AI 为什么聊着聊着就忘了你说的话:它没有“记住”这一步,只有“这次递进去多少”

它不是记住了又忘掉。模型没有“记住”这个动作:你每问一次,程序都要把这次要它看的东西整份重新递一遍,而这一块地方有边界、单位是 token 不是字、还要和它的回答共用同一份预算。这篇用官方文档和有出处的研究讲清三件事:规格页上的数字该怎么读、装不下时各家怎么处理(截断还是摘要)、以及为什么装得下它照样会看漏——中间那段最容易漏,把要求拆成多轮说六类任务平均降 39%。最后给六个你当场就能用的动作,附可直接抄的话术。

AgentHub 编辑部
·15 分钟阅读
#上下文窗口#token#长对话
AI 为什么会一本正经地胡说八道:它认得出自己的错,却不会主动说
实战教程

AI 为什么会一本正经地胡说八道:它认得出自己的错,却不会主动说

模型不是在查资料,是在接话——这一句能解释所有现象。这篇用四条有出处的事实讲清它为什么编得这么像:GPT-4 报告自陈不可靠、2023 年那项研究发现它能识别自己 87% 的错误、2026 年《自然》论文指出只按准确率打分等于奖励瞎猜、以及 2025 年一年里 146,932 条不存在的引文进入学术库。再给出六种你在对话框里就能做的自查,附可直接抄的话术。

AgentHub 编辑部
·13 分钟阅读
#AI 幻觉#事实核查#提示词技巧