📚 Wiki 知识库

🏷️ 盲测

1 篇

今年高考,我让12个顶级AI一起考了语文和数学

文章记录了一次关于12个顶级AI模型的高考模拟测评。测试选取了Claude、GPT-5.5、DeepSeek等国内外主流模型,针对高考语文和数学试卷进行考核,并邀请真人老师进行盲审阅卷。结果显示,头部模型之间的分差极小,部分模型存在“偏科”现象(如DeepSeek数学强但作文弱)。文章详细回顾了测试的公平性设计、评分过程及最终排名,并回顾了过去几年AI模型在考试能力上的巨大进步。

技术LLM ✍ 数字生命卡兹克🕐 2026-06-08