AI应用测试方法(五):多轮对话评测
前四篇已经覆盖了通用断言、评分机制、RAG 评测、Agent 评测,都是单轮或近单轮的评测形态。本篇聚焦最后一种主流应用形态,多轮对话。
共 4 篇文章
从新到旧
前四篇已经覆盖了通用断言、评分机制、RAG 评测、Agent 评测,都是单轮或近单轮的评测形态。本篇聚焦最后一种主流应用形态,多轮对话。
本篇接着讲另一种主流的 LLM 应用形态(Agent 系统)的评测。
本篇聚焦在一个具体的应用形态——RAG(Retrieval-Augmented Generation)系统上的评测。
上一篇讲了 AI 测试中的断言系统,讨论的是要"判断什么"。这一篇聚焦评分机制(Scoring),来讨论如何保障"判断的准确性"。