壹零壹玖
首页
归档
2026
2026-02-06
用 Trace 做 AI Agent 的回归测试:从“能跑”到“可验证”
2026-02-05
给 LLM 测试加一道“Flakiness Firewall”:用可重复性检测 + 稳健聚合,把随机性挡在 CI 之外
2026-02-02
Schema-First 的 LLM JSON 合同测试:把“结构化输出”做成可回归的门禁(含 Mermaid 流程图 + 反例库)
2026-02-01
把 LLM 功能当成“可回归”的产品:在 CI 里跑 Evals 的最小闭环(含门禁与漂移监控)