R1 · 手写识别基准
用真实用户的手写作答图像(填空题与解答题,含数竞选手的难辨认字迹) 对多个手写识别模型做基准测试,衡量「读图 → 提取作答」的准确率。
首批基准结果将在此发布。
LearnLoops Research
这里是 LearnLoops 的实验室:mo24 研究线的各项实验结果会陆续发布在这里, 可直接浏览,也可以在线试用。
2026-09-03 · mo24 · 判题/批改基线已发布
用真实用户的手写作答图像(填空题与解答题,含数竞选手的难辨认字迹) 对多个手写识别模型做基准测试,衡量「读图 → 提取作答」的准确率。
首批基准结果将在此发布。
一试解答题的 AI 批改与评分研究:以官方评分细则(每题 20 分、约 4 个采分点) 为基准,让不同模型对学生作答评分,迭代出更准、更便宜的评分提示词。
评分对比与提示词演进记录将在此发布。
填空题 AI 判题的正确性研究:用带用户反馈的真实作答样本, 比较不同模型的判定正确率,定位现有判题的问题。
判题正确率报告将在此发布。
一试题库(3600+ 题)的更精确难度与标签重标注, 完成后重新导入题库,并在这里展示前后对照的样例。
重标注样例对照将在此发布。
小奥题库的更精确难度与标签重标注(研究机上进行中), 完成后重新导入题库,并在这里展示样例。
重标注样例对照将在此发布。
研究起步前对现行 AI 判题(填空)与 AI 批改(解答)的一次全量体检:规模、各模型判定分布、失败模式与用户反馈归类。研究结论发布后会替换/细化本节。
已完成的 fill_grading 调用,按生产先后使用的两代判题模型拆分。
已完成的 other_grading 调用。拟判仅供参考,不改变学生自评;mo24 将升级为 20 分制采分点评分。
85 次未完成调用的错误码分布——一半以上是上游可重试错误,属工程问题而非判题质量。
ai_grading 类反馈 6 条(措辞已改写归类,不引用原文)。