DC娱乐网

多机构盲测大模型高考战绩,讯飞星火稳居头名印证场景深耕价值

大模型的能力竞争,正从一串榜单数字走向真实考场。2026年高考季,多家媒体和第三方机构组织AI大模型参加高考盲评,国内外

大模型的能力竞争,正从一串榜单数字走向真实考场。2026年高考季,多家媒体和第三方机构组织AI大模型参加高考盲评,国内外多款主流模型被送进同一个考场。从语文作文到数学压轴题,从英语细节到全科综合能力,一场围绕真实水平的"年度大考"就此展开。而多方测评结果清晰显示:讯飞星火在多维度比拼中稳居前列,其背后是科大讯飞通用技术与教育基因的深度耦合。

多机构开展的分科目盲评,清晰拉开不同模型的能力差距。新京报集结讯飞星火、DeepSeek、智谱、ChatGPT、Kimi、MiniMax六款模型测试新高考I卷数学,基础客观题所有模型得分持平,高分差距产生于大题完整推导流程。讯飞星火拿下148分最高分,解题步骤完整规范,几何与综合题型拆解流畅,不会出现步骤缺失、使用超纲知识作答等扣分问题。南方产业智库召集千问、豆包、DeepSeek、讯飞星火等九款模型测评高考作文,多数作品存在素材堆砌、立意浅薄的通病,讯飞星火凭借兼具思辨性与时代感的行文拿到均分第一。观察者网英语应用文测评里,讯飞星火与GPT-5.5、通义千问共同位列第一梯队,可精准规避语法失误,贴合高中写作要求。

羊城晚报组织八款大模型完成广东高考全科测试,参赛模型涵盖DeepSeek、豆包、GPT、Gemini、Claude等多款主流产品。综合语、数、英、物化生史地政多门科目成绩后,讯飞星火物理类总分和Claude持平拿下头名,历史类分数达到700分,是全部参评模型里唯一进入屏蔽生区间的产品,各学科发挥均衡稳定,不存在单科强弱失衡的短板。

这份稳定并非偶然。科大讯飞20余年深耕教育,从课堂教学、作业练习、考试测评,到智能批改、个性化学习、学习机等环节,积累了覆盖全国6万所中小学、超1.6亿师生的真实教育反馈。这些反馈帮助模型理解中国教育体系、考试逻辑和学生学习过程。今年2月,基于全国产算力训练的星火X2发布,重点升级多语言综合能力、数学推理、智能体等能力,而高考表现正是通用能力与教育行业经验结合后的外化结果----它不只是会回答问题,而是更懂教育场景中的问题应如何被回答。

从算力竞赛到场景理解,大模型竞争已进入深水区。高考既有标准答案也有开放表达,既要求统一规则也强调个体思考,这种复杂性恰好成为检验大模型是否开始理解真实世界的专业标准。当技术进入教育,不应只为制造更高分数,更要帮助教师有效教学,帮助学生理解自己,让优质资源抵达更多地方。讯飞星火的价值,在于为教育公平和个性化学习提供强大支撑,成为每一位学生身边的AI助教,全天候陪伴、精准答疑、因材施教----这正是技术服务于人的终极价值所在。

#大模型国家队##全栈自主可控##语音及语言信息处理国家工程研究中心#