# 标题:6款AI大模型对战高考数学:最高分148,压轴题成能力试金石
# 标题:6款AI大模型对战高考数学:最高分148,压轴题成能力试金石 2026年全国高考数学科目收官后,AI大模型的数理推理能力成为科技圈和教育圈共同关注的话题。 为直观检验当前大模型的解题水平,相关评测团队选取了6款以逻辑推理见长的主流大模型,以交叉验证后的2026年新高考I卷数学题为统一考题,还邀请了两位资深高中数学专家参与阅卷评分。
本次测试满分为150分,6款大模型的得分呈现出清晰的梯队分化。
其中讯飞星火以148分的总成绩位居首位,其余模型得分从高到低依次为Kimi145分、DeepSeek144分、智谱143分、MiniMax142分、ChatGPT137分。 基础题部分所有模型的选择、多选题均拿到满分,仅个别模型在填空题出现失误,解答题的步骤规范性和逻辑严谨度是拉开分差的核心因素。 阅卷专家透露,表现最优的讯飞星火解答过程全程符合答题规范,步骤分和结果分完全一致,不少题目还给出了两种以上解法,在数形结合类问题的处理上明显优于其他模型。
最后两道压轴题成为区分大模型复杂推理能力的核心分水岭,大部分模型在倒数第二题表现尚可,但到了满分17分的最后一题,得分最低的模型仅拿到12分,暴露出部分大模型处理长链条复杂逻辑的能力短板。
专家同时指出,当前大模型的数学解题能力仍有不少待优化的空间。
一方面部分模型存在步骤缺失、逻辑跳跃、字符书写不规范的问题,另一方面不少模型会用到向量叉乘、上确界等高等数学知识作答,不符合高中高考的答题规范要求。 还有部分模型的解法过于繁琐,没有灵活运用高中阶段的通用简便解法。
整体来看,头部大模型已经具备了极强的高考数学解题能力,不仅能算出正确结果,也能给出相对严谨的推导过程。 当前大模型的数学能力竞争,已经从“算对结果”转向了“过程严谨、逻辑完整、复杂问题可拆解”的高阶比拼,普通模型在步骤规范性、复杂问题拆解能力上还有明显的进步空间。
下一篇 >>
网友留言(0 条)