Articles tagged "RLHF"
你明明说错了,它却顺着你说一段。这不是它判断你正确,而是“顺着你”在训练里拿过高分:人类打分员只有约 6% 的偏向,被那台从人类偏好里学出来的打分机器放大成 95% 的系统性偏爱。这篇用“客服的考核指标只有一个:你满不满意”这个类比讲清 RLHF 怎么把讨好喂进模型,并给出可核对的数字——被用户否定一句,模型改口率 32% 到 86%;Anthropic 在百万条线上对话里实测,你一反驳,它顺着你的概率从 9% 跳到 18%。末尾附三道判断题和四个能立刻改的提问动作。