手游营地,热门手游攻略、新游测评、礼包兑换一站式平台
当前位置: 网站首页 资讯中心 软件资讯 正文
软件资讯

八款主流大模型参与高考全科测评 讯飞星火与Claude并列物理类榜首

软件资讯 来源:互联网 作者:pconline 发布时间:2026-08-02 05:11:16

据悉,近日有机构采用2026高考试题,对八款国内外主流大模型进行了全科横向测评,并邀请资深教师进行独立盲评。测评结果显示,在物理类总分排名中,Claude-Opus-4.8和讯飞星火-X2以708分并列第一,进入广东屏蔽生行列。在历史类总分排名中,仅讯飞星火-X2超过700分,同样进入屏蔽生行列。其他模型如豆包、DeepSeek、GLM、ChatGPT、Gemini等也在部分科目中表现突出,呈现出不同的能力侧重。

本次测评严格对标高考流程,语文、数学、英语三科使用新课标I卷,选考科目则主要采用广东省自主命题试卷。所有模型均采用相同提示词和最高思考模式,回答内容为一次性生成,并由两名教师根据高考评分细则进行独立盲评。从最终成绩看,头部大模型之间的竞争已进入多学科综合能力比拼阶段,全科稳定性成为决定总分排名的关键因素。

从单科表现来看,各模型能力路线差异明显。在语文、英语等语言科目中,头部模型分差较小,作文立意与表达稳定性是主要区分点。在数学、物理等理科科目中,压轴题和多步骤推导题更能考验模型的复杂推理与过程规范能力,区分度更高。在选考科目中,不同模型的表现取决于其能否将读题、推理和规范作答完整串联。

针对测评结果,有专家表示,AI解题能力正高速进化,这提示教育需要进行深层次的变革。专家预测,约一年后AI或能在普通高考数学卷中取得满分。AI将逐步替代低层次计算劳动,推动人类学习重心向更深层的原理与思维方法迁移,并可能促使中小学课程内容深度整体提升。同时,AI解题能力的提升也将推动学校教研体系向深耕难题与创新题型转型。

分析指出,大模型在高考中取得高分已成为常态,但这并不意味着机器智力超越人类或教育体系将被颠覆。AI的高分是算法基于海量数据完成的概率最优推理,不具备人类考生的情感、经历与人格成长。其真正的社会价值在于填补教育资源不均衡的空白,提供普惠的个性化辅导,而非进行人机竞技。必须警惕教育因AI擅长应试而向纯粹的标准化训练靠拢,技术的核心应是服务于人的全面成长。

相关资讯 more..
手游营地
据悉,MiniMax发布新一代多模态生成模型MiniMax H3,并宣布将于近期开源。H3是MiniMax从“特化任务模型”迈向“通用多模态智能”的重要探索,其不再以单一任务为边界,而是在多模态上下文
手游营地 08-01 2
手游营地
快科技7月31日消息,在ChinaJoy现场,REDMI展示了K100 Pro Max真机,并且直播为大家带来了真机上手展示。这次展示的是K100 Pro Max全新“赤霞珠红”配色,尚未公布其他配色
手游营地 08-01 3
手游营地
第56届国际物理奥林匹克竞赛(IPhO 2026)日前正式落幕,华为小艺在理论考试中取得28.6分(满分30分) 的优异成绩,高分超出理论金牌线。本届IPhO竞赛汇聚全球90多个国家和地区的400余名
手游营地 08-01 2
手游营地
据悉,小米旗下增程车型Sky Nomad打破行业惯例,同时采用禾赛科技和速腾聚创两家激光雷达供应商的产品,前向主激光雷达来自禾赛,速腾则提供辅助感知方案。此举打破了车企通常绑定单一供应商的合作模式,对
手游营地 08-01 1