摩西云 Demo
全部场景
集成指南
现场炫技
更多场景
模型质量评分
被评模型先作答,再由更强的裁判模型按准确性 / 相关性 / 完整性 / 安全性四维打分
返回首页
过去靠人工
人工逐条读答案、凭感觉判断好坏,难量化、难复现
现在用 AI
LLM-as-judge 自动四维打分 + 总分 + 评语,可批量可追溯
价值提升
评测从主观到可量化
LLM-as-judge 自动评测
·
qwen-plus 作答 → qwen-max 当裁判,输出结构化四维评分,可规模化做质量基线
出一道题考考模型
公司想从 0 搭建一套数据中台,应该分哪几步?
公司想从 0 搭建一套数…
解释一下 Transfo…
新员工入职第一周,作为 …
作答并评分