据悉,近日有机构采用2026高考试题,对八款国内外主流大模型进行了全科横向测评,并邀请资深教师进行独立盲评。测评结果显示,在物理类总分排名中,Claude-Opus-4.8和讯飞星火-X2以708分并列第一,进入广东屏蔽生行列。在历史类总分排名中,仅讯飞星火-X2超过700分,同样进入屏蔽生行列。其他模型如豆包、DeepSeek、GLM、ChatGPT、Gemini等也在部分科目中表现突出,呈现出不同的能力侧重。
本次测评严格对标高考流程,语文、数学、英语三科使用新课标I卷,选考科目则主要采用广东省自主命题试卷。所有模型均采用相同提示词和最高思考模式,回答内容为一次性生成,并由两名教师根据高考评分细则进行独立盲评。从最终成绩看,头部大模型之间的竞争已进入多学科综合能力比拼阶段,全科稳定性成为决定总分排名的关键因素。
从单科表现来看,各模型能力路线差异明显。在语文、英语等语言科目中,头部模型分差较小,作文立意与表达稳定性是主要区分点。在数学、物理等理科科目中,压轴题和多步骤推导题更能考验模型的复杂推理与过程规范能力,区分度更高。在选考科目中,不同模型的表现取决于其能否将读题、推理和规范作答完整串联。
针对测评结果,有专家表示,AI解题能力正高速进化,这提示教育需要进行深层次的变革。专家预测,约一年后AI或能在普通高考数学卷中取得满分。AI将逐步替代低层次计算劳动,推动人类学习重心向更深层的原理与思维方法迁移,并可能促使中小学课程内容深度整体提升。同时,AI解题能力的提升也将推动学校教研体系向深耕难题与创新题型转型。
分析指出,大模型在高考中取得高分已成为常态,但这并不意味着机器智力超越人类或教育体系将被颠覆。AI的高分是算法基于海量数据完成的概率最优推理,不具备人类考生的情感、经历与人格成长。其真正的社会价值在于填补教育资源不均衡的空白,提供普惠的个性化辅导,而非进行人机竞技。必须警惕教育因AI擅长应试而向纯粹的标准化训练靠拢,技术的核心应是服务于人的全面成长。








