2026年高考期间,12款国内外领先的人工智能大模型参与了语文和数学的模拟考试,旨在评估其在这两门传统重要学科中的表现差异与综合能力。

本次测试范围涵盖了目前市场上的主流AI旗舰模型,其中包括国外的Claude Opus 4.8、GPT-5.5、Gemini 3.1 Pro,以及国内的千问3.7 max、文心Ernie 5.1、星火Spark X2、智谱GLM5.1、Kimi k2.6、MiniMax M3、DeepSeek V4 Pro、小米MiMo v2.5 Pro和混元3。

为了确保评分的专业和公正,主办方特意邀请了3名具有阅卷经验的语文教师和1名数学教师参与卷面评分。由于语文阅卷可能存在一定主观性,最终成绩采纳3位语文老师的平均分,数学成绩由专业老师评分,实现了评测的公平性和准确性。

背景与评分细节

此次测试语文部分采用了中国考试官方发布的部分试题及参考答案,满分按比例换算至150分,由于完整试卷未及时获取,试题覆盖面有限。数学部分则选用了完整的全国一卷真题,保证测试的权威性和严谨度。

评卷过程历时数小时,老师们对12份试卷逐一细致批改,保证数据的可靠性。

测试影响与后续关注点

此次AI模拟高考测试不仅反映了当下人工智能在语文理解和数学算法推理方面的能力,也揭示了各大模型在不同领域的优势与不足。随着AI技术的不断进步,其在教育辅助、个性化学习方案制定等方面的应用潜力日益受到重视。

未来,监管机构、教育部门和技术开发者如何合作,推动AI合理融入高考及其他教育环节,成为值得持续关注的重点。

文章来源:https://finance.sina.com.cn/cj/2026-06-08/doc-iniasfpu5655196.shtml