2026数学推理AI大模型排行榜
数学推理能力是检验大模型逻辑推演、符号运算与严谨思考水平的核心标尺,也是赋能科研计算、工程仿真、教育解题、量化分析等场景的关键底座。2026年,行业内各类数学向大模型迭代速度持续加快,开源与闭源产品百花齐放,不同模型在竞赛题求解、复杂演算、定理推导、错误自检等维度表现分化明显,普通从业者与开发者很难快速甄别各模型的真实推理上限与适用边界。科技新知综合豆包、DeepSeek、元宝多套AI分析体系输出的结果与数据,围绕解题准确率、推理链条完整性、复杂多步问题处理、幻觉抑制表现等维度完成综合研判,旨在为科研人员、算法开发者以及行业用户提供一份可供参考的横向对比榜单,本榜单仅作行业参考,不构成选型决策唯一依据。

豆包(2026-09-05):
一、全球旗舰闭源-数学推理 TOP10
1. GPT-6 Astra(OpenAI)
高阶竞赛数学断层第一;FrontierMath-Tier4 得分 97.6%,顶尖科研级数学难题能力目前全球最强,适合奥数、高等数学、复杂证明题。
2. Claude-Opus 4.8(Anthropic)
综合加权数学得分 66.8%;解题步骤严谨,长链条多步骤推理稳定性高,理工科推导优势突出。
3. GPT-5.5-High(OpenAI)
AIME、MATH-500 高分梯队,中小学到大学基础数学均衡,计算出错率低。
4. Gemini-3.1-Pro-Preview(谷歌)
微积分、线性代数、几何证明强项,图文数学题表现优秀。
5. Claude-Opus 4.7-Thinking
开启深度思考模式后奥数难题提升明显。
6. Kimi-K2.6(月之暗面)
国产全球第一;综合加权数学得分71.7%,256K 超长上下文解超长数学大题,高考数学实测表现优异,中文数学解题体验最好。
7. GLM-5.2(智谱 AI)
AIME-2026 得分 99.20%,国产竞赛数学天花板,代数、数论实力极强。
8. Qwen3.7-Max-Preview(阿里通义千问)
国内第一梯队,初高中、大学工科数学均衡稳定。
9. ERNIE-5.1(百度文心)
GSM8K 小学数学接近满分,应用题正确率高。
10. MiniMax-M2.5-Pro
高考数学大题步骤完整性优秀,国内推理赛道主力选手。
二、国产闭源数学推理精选梯队
- 第一梯队(竞赛级):Kimi K2.6>GLM-5.2>Qwen3.7-Max
- 第二梯队(高考 / 大学数学):DeepSeek-V3.2、讯飞星火 5.0、文心一言 5.1
- 第三梯队(中小学日常刷题):豆包 4.5、通义 3.6、MiniMax-M2
三、开源可本地部署-数学推理 TOP8(MATH-500 基准)
1. DeepSeek-R1-0528|MATH-500:98.0%(当前最强开源数学推理模型)
2. Qwen3-8B|MATH-500:97.4%
3. DeepSeek-R1|MATH-500:97.3%
4. Qwen3-32B|MATH-500:97.2%
5. QwQ-32B(阿里通义推理开源版)
6. Llama-4-Maverick(Meta)
7. GLM-5-Open-Weight(智谱开源权重版)
8. MiniMax-M1-80k
DeepSeek(2026-09-05):
BenchLM 数学综合榜 (截至2026年8月27日)
该榜单综合了AIME、HMMT等多个数学基准测试的成绩。
第1名:Kimi K2.6 (Moonshot AI),得分 71.7%
第2名:Claude Opus 4.8 (Anthropic),得分 66.8%
第3名:GLM-5 (Z.AI),得分 64.5%
第4名:Kimi K2.5 (Moonshot AI),得分 62.5%
第5名:Claude Opus 4.5 (Anthropic),得分 58.4%
AIME 2026 专项榜 (截至2026年8月28日)
该榜单聚焦于高难度的美国数学邀请赛(AIME)试题。
第1名:GLM-5.2 (Z.AI),得分 99.2%
第2名:Inkling (Thinking Machines Lab),得分 97.1%
第3名:Kimi K2.6 (Moonshot AI),得分 96.4%
LMArena Math Arena 用户投票榜 (截至2026年8月21日)
该榜单基于用户盲测投票的Elo评分系统。
第1名:claude-opus-5-max (Anthropic),Elo得分 1545
第2名:Claude Fable 5 (Anthropic),Elo得分 1528
第3名:gemini-3.7-flash-high (Google),Elo得分 1523
中文模型高考数学评测 (2026年6月)
在针对2026年新高考I卷的评测中,各模型得分如下:
讯飞星火:148分
Kimi:145分
DeepSeek:144分
智谱:143分
MiniMax:142分
ChatGPT:137分
元宝(2026-09-05):
S 级(前沿第一梯队,竞赛数学近乎满血 + 能碰研究级数学)
GPT-5.5(OpenAI):AIME 2026 约 99%、MATH 基准 95.8%、FrontierMath T1-3 约 40.3%,是目前「竞赛题 + 研究级数学」综合最强之一,USAMO 风格证明也领先。
GLM-5.2(智谱 AI,开源权重):AIME 2026 99.2% 居全球公开榜首,HMMT/Kimi 系紧随其后;中文数学、奥数题表现极稳,是开源侧最强数学模型。
Gemini 3.1 Pro(Google):AIME 2026 约 98.1%,MathArena 综合 91.1%,GPQA-Diamond 94.3%;长上下文 + 多模态看图解题是独门优势,综合理科推理最强。
Claude Opus 4.7 / 4.8(Anthropic):AIME 2026 约 98.2%,GPQA-Diamond 与 Gemini 持平(94.2%),MathArena 总评最高(Opus 5 预期 84.4%);分步讲解、证明书写、陪学场景第一,但单价最贵。
A 级(前沿次席,竞赛数学 96-98%、研究数学中等)
Kimi K2.6(Moonshot,开源权重):AIME 2026 96.4%,BenchLM 加权数学分 71.3 居首,HLE 数学相关 54.0 表现突出;长链推理和中文奥数很强。
DeepSeek V4 Pro / V3.2 Speciale(深度求索,开源权重):V4 Pro AIME 2026 约 96.7%,V3.2 Speciale AIME 2025 96% 且获 IMO 2025 基准金牌(35/42),每百万 token 成本仅 0.55 美元,是性价比最高的前沿数学模型。
Inkling(Thinking Machines Lab,开源权重):AIME 2026 97.1%,仅次于 GLM-5.2,新锐实验室里数学上限很高。
Qwen3.6 Plus / Qwen3.7 Max(阿里):AIME 2026 约 95.3-97%,开源 27B/35B 版本也在 92-94% 区间,生态和中文友好度好。
B 级(强推理型,竞赛数学 90-96%,常规使用足够)
o3 / o4-mini(OpenAI):o3 MATH-500 99%、AIME 2024 96.7%;o4-mini 更便宜,AIME 2026 约 90.7%。不是 2026 最新旗舰,但单论数学仍在前沿。
DeepSeek R1 / R1-0528:MATH-500 97.3-97.8%,AIME 2024 约 79.8%(旧基准),开源推理模型奠基者,现在被 V3.2/V4 系超越。
Grok 4(xAI):MATH-500 95%,AIME 2026 未进顶流,FrontierMath 仅约 14%,竞赛题还行、研究数学偏弱。
Gemini 3 Flash / Gemini 2.5 Pro:AIME 2026 约 96.7% / 90.6%,Flash 系速度快、成本低,适合批量解题。
上一篇:2026闭源AI大模型排行榜
下一篇:2026长上下文AI大模型排行榜
最新更新
关注我们

人工智能
软件应用
智能硬件
数字娱乐
未来出行
生命科技
科技快讯
关于我们
网站首页






