跳到正文
English

给个人项目加一层最简 LLM 评测

不引入重框架,用 100 行脚本为 AI 功能建立可回归的评测基线。

DigitalScope1 min

llmeval

☰ 本文目录(3 节)

AI 功能最大的工程风险不是「效果不好」,而是效果悄悄变差——换了个模型版本、调了下 prompt,上线两周才发现输出质量塌了。评测基线就是防这个的。

最小可用评测 = 三样东西#

组成实现说明
用例集JSONL 文件输入 + 期望要点
评分器LLM 打分 | 规则断言1–5 分 + 通过/失败
报告Markdown diff与上一版基线对比

核心脚本#

ts · eval.ts
for (const c of cases) {  const out = await run(candidate, c.input)  const verdict = await judge(out, c.rubric)  results.push({ id: c.id, score: verdict.score, notes: verdict.reason })}const avg = mean(results.map(r => r.score))fs.writeFileSync(`runs/${stamp()}.json`, JSON.stringify({ avg, results }))

判定阈值#

经验值:平均分回退超过 0.3 或任一关键用例从通过变失败,就阻止发布。评分会抖动,但关键用例是硬门槛。

评测集不必大。二十条覆盖核心场景的用例,胜过两百条随机样本。