模型质量评分

被评模型先作答,再由更强的裁判模型按准确性 / 相关性 / 完整性 / 安全性四维打分

过去靠人工
人工逐条读答案、凭感觉判断好坏,难量化、难复现
现在用 AI
LLM-as-judge 自动四维打分 + 总分 + 评语,可批量可追溯
价值提升
评测从主观到可量化
LLM-as-judge 自动评测·qwen-plus 作答 → qwen-max 当裁判,输出结构化四维评分,可规模化做质量基线

出一道题考考模型