垂直AI大模型排名
当前,AI大模型正从通用能力竞赛加速转向垂直领域深耕,医疗、法律、金融、工业等赛道的专用模型,凭借对行业知识的深度融合与场景适配,成为产业落地的核心引擎。2026年,垂直大模型竞争格局日趋明晰,国产模型强势崛起,在多个关键领域已比肩国际顶尖水平。科技新知综合豆包、DeepSeek、元宝三大平台发布的行业评测数据与落地实践反馈,结合MedBench、LegalBench、CNFinBench等权威榜单,系统梳理医疗、法律、金融、工业、代码五大核心赛道的垂直大模型排名,剖析头部模型的核心优势与技术壁垒,为企业选型、行业应用提供精准参考。

豆包:
一、医疗大模型
百川Baichuan-M4(百川智能):HealthBench 总分68.6,Hard 子集57.2,幻觉率3.3%,全球第一。
平安医疗大模型3.5(平安科技):HealthBench Hard57.27分,超越GPT-5.5、Claude Opus4.7。
惠每医疗大模型(惠每科技):MedBench 自测榜99.6分,4项维度第一。
数坤坤多模态V3(数坤科技):MedBench 多模态榜63.6分,临床影像分析领先。
GPT-5.5/Claude Opus 4.7(OpenAI/Anthropic):原子技能榜前二,通用医疗问答强。
二、法律大模型
Claude Fable 5(Anthropic):法律综合第一,合同分析与推理最优。
GPT-5.6 Sol(OpenAI):长文本法律理解强,上下文1M+ token。
DeepSeek-R1(深度求索):开源法律榜第一,得分71.7,性价比高。
Qwen3.7 Max(阿里):多语言法律文档处理强。
LexisNexis +AI(律商联讯):法律检索与判例分析标杆。
三、金融大模型
PingAnGPT-Qwen3-32B(中国平安):CNFinBench 综合66.1分,第一。
Qwen3.7 Max(阿里):金融分析与会计推理第一。
GPT-5.6 Sol Pro(OpenAI):量化推理准确率90.76%。
DeepSeek-R1(深度求索):开源金融榜第一,671B参数。
阶跃星辰 Step-2-16k(阶跃星辰):金融应用评测79.7分。
四、工业大模型
盘古(华为):工业全场景覆盖,智能制造标杆。
光明(国家电网):电力行业第一,电网调度与运维领先。
宝联登(宝信软件):钢铁冶金领域最强,产线优化突出。
昆仑(中国石油):油气勘探与生产专用,工业机理融合深。
擎源(国家能源集团):能源化工领域领先,设备故障诊断强。
五、代码/前端大模型
Kimi K3(月之暗面):前端开发榜1679分,第一。
Claude Fable 5(Anthropic):通用代码生成强,复杂项目适配好。
GPT-5.6 Sol(OpenAI):算法与系统设计最优,推理深度领先。
GLM-5.2 Max(智谱 AI):前端榜1587分,国产第二。
DeepSeek V4 Pro(深度求索):数学与代码双强,性价比高。
DeepSeek:
一、医疗领域
HealthBench:一个权威的医疗评估基准,其评分标准由262位来自26个专科、60个国家的医生制定。
Meta Muse Spark 1.1:在AI评估平台Vals AI的医疗文档类别中排名第一,得分88.89%。
二、法律领域
LegalBench:由40位律师和法学教授共同构建的协作评估,包含162项任务。
LegalBench-RAG:首个专门评估法律场景下检索增强生成(RAG)效果的基准。
Meta Muse Spark 1.1:在Vals AI的法律Agent测试中排名第一。
三、金融与咨询领域
APEX (AI Productivity Index):一个包含200个测试案例的基准,覆盖投资银行、管理咨询、法律和初级医疗四个领域。
在该基准的评测中,各领域模型的最高分分别为:投资银行63.0%,管理咨询64.0%,医疗65.5%,法律77.9%。
四、代码与智能体领域
代码榜:在Arena平台近期榜单中,claude-opus-4-7-thinking曾登顶代码榜榜首。
前端开发榜:国产模型kimi-k3曾在该榜单中登顶。
智能体执行:珠海金智维的KV-Ground模型,在ScreenSpot-Pro高精度界面定位评测中,其8B参数版本位列全榜单第一。
元宝:
一、医疗大模型
1、WiseDiag-v2 WiseDiag Technology 综合分71.30
2、Gemini-3.1-Pro-Preview Google 综合分69.80
3、DeepSeek-v4-Pro DeepSeek 综合分72.90
4、Qwen3.6-Plus 阿里云 综合分75.10
5、GPT-5.4 OpenAI 综合分73.70
二、金融大模型
1、PinganGPT-Qwen3-32B(中国平安)—— 综合66.1分,摘得榜首
2、DeepSeek-R1 —— 66.0分,金融专业知识单项第一(73.5分)
3、Doubao-1.5-pro(字节)—— 64.3分,合规与风险控制单项第一
4、Claude-sonnet4(Anthropic)—— 63.5分
5、Qwen3-235B-A22B-Instruct(阿里)—— 62.2分
三、法律大模型
1、JusticeNow(智利)— 93.5%
2、Harvey Assistant(Global)— 93.3%
3、Paxton AI(美国)— 93.2%
4、Matnar CL — 91.3%
5、Claude Opus 4.7(en Harvey) — 89.0%
四、工业大模型
1、华为 盘古
2、国家电网 光明
3、宝信软件 宝联登
4、中国石油 昆仑
5、国家能源集团 擎源
五、办公、语音、Agent等细分赛道
1、金山办公WPS AI表格Agent(Seed 2.0) —— SpreadsheetBench Full912 全球第一(73.46%),超越Google、Microsoft、OpenAI
2、无界方舟ARK-ASR-3B —— Hugging Face Open ASR Leaderboard 总榜第一(WER 4.76%)
3、金智维KV-Ground-GuiOwl1.5-0315-8B —— ScreenSpot-Pro 界面定位全榜第一(80.5分)
上一篇:全球AI大模型实力排名
下一篇:开源AI大模型排名

人工智能
软件应用
智能硬件
数字娱乐
未来出行
生命科技
科技快讯
关于我们
网站首页






