给个人项目加一层最简 LLM 评测
不引入重框架,用 100 行脚本为 AI 功能建立可回归的评测基线。
☰ 本文目录(3 节)
AI 功能最大的工程风险不是「效果不好」,而是效果悄悄变差——换了个模型版本、调了下 prompt,上线两周才发现输出质量塌了。评测基线就是防这个的。
最小可用评测 = 三样东西#
| 组成 | 实现 | 说明 |
|---|---|---|
| 用例集 | JSONL 文件 | 输入 + 期望要点 |
| 评分器 | LLM 打分 | 规则断言 | 1–5 分 + 通过/失败 |
| 报告 | Markdown diff | 与上一版基线对比 |
核心脚本#
for (const c of cases) { const out = await run(candidate, c.input) const verdict = await judge(out, c.rubric) results.push({ id: c.id, score: verdict.score, notes: verdict.reason })}const avg = mean(results.map(r => r.score))fs.writeFileSync(`runs/${stamp()}.json`, JSON.stringify({ avg, results }))判定阈值#
经验值:平均分回退超过 0.3 或任一关键用例从通过变失败,就阻止发布。评分会抖动,但关键用例是硬门槛。
评测集不必大。二十条覆盖核心场景的用例,胜过两百条随机样本。