编写评测(Evals)
io.github.PostHog/posthog/writing-evals
讲解如何在 `products/posthog_ai/eval_harness/` 框架上编写与运行 evals——包括针对预置 Hedgebox 项目在 Docker 或 Modal 沙箱中执行真实编码代理的沙箱化 agent 套件,以及每个用例对单次进程内模型调用打分的 one-shot 套件。当在 `products/posthog_ai/evals/` 或 `products/*/evals/` 下新增或修改 eval 套件、用例、scorer、seeder、synthesizer,改动 `products/posthog_ai/eval_harness/` 下的框架,或运行/调试这些 evals(`hogli evals`)时使用。涵盖套件类型与发现机制、用例结构、seeder/synthesizer 分工、单分支 scorer 模式,以及结果解读。不适用于 `ee/hogai/eval/ci/` 的 pytest evals,也不适用于 LLM Analytics 产品的评估功能。