以新知观科技,以远见望未来!

多任务机器学习模型排名

2026-07-28 10:56:37分类:机器学习编辑:科技新知

随着人工智能技术快速迭代,多任务机器学习模型凭借可同步适配理解、推理、创作、代码生成等多元场景任务的核心优势,成为行业落地与技术评测的核心研究方向,模型综合性能的横向对比也具备了重要的参考价值。为客观、直观地呈现主流多任务机器学习模型的实际表现,科技新知依托豆包、DeepSeek、元宝三款主流AI模型的实测数据与专项测试结果,从任务适配能力、输出稳定性、场景泛化性、响应效率等核心维度开展系统性对比排名,梳理各模型在不同任务场景下的优势与短板,旨在为开发者选型、行业应用落地及技术研究参考提供真实、全面的量化依据,清晰展现现阶段主流多任务机器学习模型的综合实力梯队。

多任务机器学习模型排名

豆包:

一、纯文本多任务大语言模型(通用知识 + 推理多任务,MMLU/MMLU-Pro)

闭源旗舰梯队(综合多任务能力 TOP)

1. GPT-5.5(OpenAI)

MMLU:92.4|MMLU-Pro:89.7

优势:57 学科知识、逻辑推理、指令跟随、代码多任务均衡最强

2. Claude Opus 4.6(Anthropic)

MMLU:92.3|MMLU-Pro:89.5

优势:长文本、文档理解、事实性多任务

3. Qwen3.7 Max(阿里通义千问)

MMLU-Pro:89.6,中文多任务显著领先

4. Gemini 3.1 Ultra(Google)

MMLU:90.8;理科、数理多任务突出

5. DeepSeek R1 / V4 Pro

数学、代码多任务开源闭源双强

开源权重 TOP(可本地部署,多任务综合)

1. Llama 4 Maverick(Meta)

2. Qwen3.5-235B Instruct

3. DeepSeek V4

4. GLM-5.1(智谱 AI)

5. Kimi K2.6(月之暗面)

二、多模态多任务模型(图像 + 文本 + 视频统一多任务,MMMU 基准)

评判标准:VQA、OCR、图表推理、图像描述、文档解析多任务综合

闭源

1. Gemini 3 Pro(Google)|视频多任务断层领先

2. GPT-5.5 Vision(OpenAI)|图文推理均衡

3. Claude Opus 4.6 Vision|表格 / 长文档图文任务最优

4. Qwen3-VL Max|多语言图文多任务首选

开源多模态多任务 SOTA

1. InternVL3-78B

2. Qwen2.5-VL-72B-Instruct

3. Ovis2.5-34B

4. CogVLM2-72B

三、经典传统多任务学习 MTL 架构(科研 / 工业小模型,非大模型)

适用于 CV、推荐系统、表格数据多任务联合训练(单模型同时预测多个目标)

1)计算机视觉多任务

UniT:统一检测、分割、分类、追踪多任务

CoCa:视觉 + 文本跨模态多任务预训练(分类、检索、图像生成)

FLAVA:同时支持视觉任务 + NLP 任务统一预训练

MT-DNN(NLP 传统多任务标杆,BERT 衍生多任务框架)

2)推荐系统多任务(工业最常用)

PLE(Progressive Layered Extraction)|阿里,解决多任务跷跷板效应,工业首选

MMoE(Mixture of Experts)|谷歌经典基线

OneRank(2026 最新 Transformer 多任务排序框架)

ESMM、ESSM(电商转化多任务基础模型)

3)表格结构化数据多任务

TabPFN-MT:表格数据上下文多任务学习 SOTA

四、基准测试说明(看懂排名必须了解)

MMLU:57 学科多任务选择题,衡量 LLM 通用多任务理解

MMLU-Pro:更难,区分前沿模型

MMMU:多模态多学科图文多任务基准

GLUE/SuperGLUE:传统 NLP 多任务(情感分类、推理、问答),现在多用于中小模型评测

CMMLU/C-Eval:中文多任务评测

五、快速选型建议

通用问答、跨学科综合任务 → GPT5.5 / Claude Opus 4.6

中文场景、私有化部署 → Qwen3 系列、GLM-5

图文、文档、图表分析多任务 → Gemini3 / Qwen-VL

电商/信息流推荐多目标预估 → PLE > MMoE

学术研究、小模型多任务预训练 → MT-DNN、FLAVA、CoCa

DeepSeek:

1. MMT-Bench (多模态、视觉语言模型):这是一个用于评估大型视觉语言模型(LVLMs)多任务AGI能力的综合基准,包含超过3万个多选视觉问题,覆盖32个核心元任务。

当前领先者:根据其排行榜,DeepSeek VL2 和 Qwen2.5 VL 7B Instruct 并列第一,得分均为 0.636。

2. ZeroCLUE / FewCLUE (中文自然语言处理):这是中文NLP领域零样本和小样本学习的权威榜单。

当前领先者:澜舟科技的孟子多任务模型(Mengzi-T5-base-MT) 曾以0.22B的轻量级参数在这两个榜单上均排名第一。

3. WorkBench (劳动力市场/文本嵌入):这是首个专门针对劳动力市场智能(LMI)领域,将六个相关任务(如技能提取、职位标准化)统一为排序问题的评估套件。

相关模型:统一工作嵌入(UWE) 模型在该基准上表现优异,其零样本排序性能甚至超过了参数多两个数量级的通用模型(如Qwen3-8B)。

4. GlycanML (生物信息学/糖类):一个针对糖类机器学习研究的多任务、多结构基准,包含糖类分类、免疫原性预测等多样化的任务。

相关资源:该项目维护有专门的公开排行榜,可在其官网上查看。

5. MMLRec (推荐系统):这是推荐系统领域首个统一的多任务和多场景学习综合基准,旨在公平评估不同算法的性能。

研究发现:通过该基准的公平实验发现,一些结构简单的算法效果被低估,它们在复杂任务中也能取得与复杂算法相当的结果。

6. EdgeBench (具身智能/AI Agent):一个包含 134个真实世界任务 的基准,用于评估自主AI Agent在真实环境中的学习能力。它追踪模型性能的完整提升轨迹,而不仅仅是最终得分。

元宝:

一、NLP十任务统一榜单(decaNLP)

这是最常被引用的"多任务学习"权威榜单之一,在10项NLP任务(SQuAD、翻译、摘要、推理、情感等)上综合评测:

1. MQAN (Sampling + CoVe) decaNLP总分609.0

2. MQAN (QA-first + CoVe) decaNLP总分599.9

3. MQAN (QA-first) decaNLP总分590.5

4. S2S基准模型 decaNLP总分513.6

MQAN系列在decaNLP官方 Leaderboard上明显领先,采用CoVe上下文向量的版本总分比基准模型高出95分。

二、推荐/CTR 多任务建模(工业界主流演进路径)

这一支是多任务学习产业化最深的场景,模型迭代路径清晰:

1. SharedBottom — 最早的多任务模型,多个目标底层共用一套共享layer,任务相关性强、资源有限时推荐

2. ESMM(阿里)— 全样本空间多任务模型,解决CVR 预估中的样本选择偏差和数据稀疏,专门用于CTR/CVR 联合优化

3. MMoE(谷歌)— 多门控混合专家,每个任务有独立的门控网络,任务间存在冲突时使用

4. PLE(腾讯)— 渐进分层提取,独立专家 + 共享专家联合使用,缓解"跷跷板"现象,适合复杂多任务

5. AITM — 建模任务间序列依赖关系,自适应信息迁移

选型建议:任务相关性强 → SharedBottom;任务间有依赖(如点击→购买)→ ESMM 或 AITM;任务冲突明显 → MMoE 或 PLE。

三、中文小样本多任务竞赛(AIWIN 2022)

2022世界人工智能创新大赛"中文保险小样本多任务竞赛",覆盖保险、金融、医疗三大领域共18个任务,每个任务仅20条数据:

二郎神 Ubert(IDEA研究院封神榜团队)— A榜79.5、B榜80,双榜第一,B榜领先第二名超1个百分点,相对baseline提升20个百分点

该方案基于BERT设计统一框架,在1.5G模型大小限制下完成统一多任务建模。

四、具身智能多任务操作(Evo-SOTA 榜单)

在Meta-WorldMT50基准(50项机器人操作任务)上:

FabriVLA(优艾智合)— tier-average 成功率90.0%登顶第一

π0(Physical Intelligence):47.9%

SmolVLA:68.2%

RoboTron-Mani:77.7%

FabriVLA以0.89B参数量超越参数规模数倍于己的模型。

同期另一个值得关注的模型 Motubrain(生数科技)同时登顶WorldArena与RoboTwin2.0两大多任务榜单,在RoboTwin2.0 randomized场景取得96.1分,是榜单唯一随机环境下平均分超95的模型。

五、表格数据多任务

TabPFN-MT在344个数据集的广泛评估中,于深度表格多任务学习上达到新SOTA,多任务模型平均准确率排名第一,处理T个任务的推理成本从 O(T) 降到 O(1)。

本文地址:https://www.kejixinzhi.com/machine_learning/18.html 转载请注明出处,科技新知带你一起探索未知精彩!

上一篇:

下一篇:

热点推荐

关注我们

    关注我们
返回顶部