LearnLoops Research
五条 AI 数学研究线 · 点「介绍」看通俗报告,点「样例」看真实作答对照。
研究起步前对现行 AI 判题(填空)与 AI 批改(解答)的一次全量体检:规模、各模型判定分布、失败模式与用户反馈归类。研究结论发布后会替换/细化本节。
已完成的 fill_grading 调用,按生产先后使用的两代判题模型拆分。
已完成的 other_grading 调用。拟判仅供参考,不改变学生自评;mo24 将升级为 20 分制采分点评分。
85 次未完成调用的错误码分布——一半以上是上游可重试错误,属工程问题而非判题质量。
ai_grading 类反馈 6 条(措辞已改写归类,不引用原文)。