潍坊网站建设滨州网站建设

360俊星环保网 2026/09/09 18:46:34

论文链接:https://arxiv.org/pdf/2512.04810
项目链接:https://emma-umm.github.io/emma/

背景与动机

当前多模态大模型已经成为大模型领域最为重要的研究热点,尤其是随着OpenAI的GPT-4O展现出极强的多模交互生成能力,以及谷歌GEMINI依靠原生多模架构打了一场漂亮的大模型翻身仗,如何构建多模态统一架构已经成为2025年多模态大模型领域最为关心的课题。

尽管构建多模态统一架构已经成为了业界几乎所有大模型研究者的共识,但是如何构建多模态统一架构的路线目前仍然未收敛,比如1)直接利用开源的理解或生成专家模型然后中间设计桥接器来构建多模交互能力,典型代表工作比如UniWorldV1, Metaquery, OminiGen2等 2)架构统一并进行端到端原生训练以激发多模能力,但其理解与生成任务优化目标不同。代表工作如字节的BAGEL,Mogao以及Deepseek的JanusFlow 3) 追求完美统一,优化目标一致,比如EMU系列和D-DiT。但无论哪种路线,围绕大家心中最为关键的一个问题就是,多模态统一架构所训练激发的能力到底能不能超过单独的多模态理解或者多模态生成模型,从而证明多模态统一架构所具备的优势?华为近期发布的高效多模态统一架构EMMA就给出了相关答案,是可以的!

先上结果

我们先来看结果,一句话总结:EMMA以4B MOE规模的大小在多模态理解、生成、编辑等榜单上力压当前各种7B大小的统一架构模型,远超BAGEL

再来看看与单独的专家模型对比。比如在多模态理解常常测评的11个榜单上,EMMA-4B模型要比Qwen3-VL-4B取得更好的结果。

同时,在图像生成GenEval榜单上EMMA也获得了超高的分数。

具体方法和实验细节

我们来看看EMMA到底通过什么方案来取得这么好的效果呢? 核心方案:

  1. 高效压缩,平衡理解与生成Token;采用32x高效压缩的生成编码器,使得与理解分支一致,保证理解与生成的token平衡,这个近期Meta的统一架构工作TUNA也提及到理解与生成token平衡。因此,1K分辨率的图像理解和生成编码器都会编码成1024个视觉token。

  2. Token Channel-wise拼接,降低视觉Token数;理解token 和生成token 直接通道拼接而不是token 数拼接,这样在做信息融合的时候避免token爆炸,有利于多模交互场景;

  3. 采用共享及解耦网络机制;在原生多模知识共享(这点大家可以参考对照生成需要REPA loss)的同时满足任务特异性建模(理解语义建模,生成需要语义和高频信息建模)

  4. 理解编码器siglip2改成专家混合架构mixpert,以应对多样的输入图像类型。

其整体架构图和训练细节如下。 基于上述方案,EMMA在满足高效的同时(例如编辑任务降低5倍视觉token)达到SOTA性能,相较于BAGEL7B有大幅提升。同时相较于Qwen3-VL-4B进行了对比在11个理解榜单取得了相当甚至更优的结果

可视化结果

最后我们再来看一些具体的可视化结果

是不是EMMA的生成能力相当能打?

总结

EMMA通过高效的编码器设计融合策略和网络结构语义共享及高层任务解耦机制,能够高效地完成原生多模态统一架构训练,最终配合上高质量的数据工程和训练方案EMMA能够在多模态理解、生成及编辑等榜单上大幅超过BAGEL。相较于理解SOTA模型Qwen3-VL-4B以及Qwen-Image也能展现出具备竞争力的结果。EMMA进一步揭示了原生多模态统一架构的潜力,也证明了原生多模态统一架构是能够超越专有模型的,为后续多模态统一架构研究奠定坚实的基础。

参考文献

[1] EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈,一经查实,立即删除!

义乌网站建设宝应网站建设

AutoGPT项目蓝绿部署实践:零停机切换保障在AI智能体逐渐从实验原型走向生产落地的今天,一个核心问题浮出水面:当AutoGPT正在为用户撰写一份长达数小时

2026/06/30 12:31:01

宜兴网站建设杭州 网站建设

PyTorch分布式训练入门:Miniconda-Python3.10配置多GPU环境在深度学习模型动辄上百亿参数的今天,单块GPU早已无法满足训练需求。从BERT到LLa

2026/06/30 14:13:39

律师网站建设扬州网站建设

在数字化办公时代,电子签名已成为企业和个人日常工作的必备工具。然而,商业电子签名服务的高昂费用往往让人望而却步。OpenSign作为一款完全开源免费的电子签名平台ÿ

2026/06/30 10:03:48

网站建设价格网站建设维护

如何用Docker Calibre Web快速搭建个人云端图书馆【免费下载链接】docker-calibre-web项目地址: https://gitcode.com/gh_mirrors/do/do

2026/06/30 11:05:53

唐山网站建设网站建设发展

使用HuggingFace Accelerate简化分布式训练配置在深度学习模型日益庞大的今天,动辄上百亿参数的模型已经让单卡训练变得不再现实。无论是BERT、T5这样的语言模型

2026/06/30 12:28:01

福州网站建设济南营销型网站建设

第一章:PHP图像识别精度优化的挑战与机遇随着人工智能与Web应用深度融合,PHP作为广泛使用的服务端脚本语言,正逐步承担起图像识别任务的调度与后处理职责。尽

2026/06/30 14:08:38

建设网站教程广州建设网站

Windows系统权限终极管理指南:一键获取TrustedInstaller权限的完整教程【免费下载链接】LeanAndMeansnippets for power users项目地址:

2026/06/30 10:14:49

信阳网站建设鞍山网站建设

PostgreSQL pgvector扩展完整安装与实战指南:从零开始构建AI向量数据库【免费下载链接】pgvectorOpen-source vector similarity sea

2026/06/30 10:42:22

网站建设设计塘沽网站建设

这项由武汉大学李瑞林、上海创新学院王议斌以及复旦大学朱文鸿等多位研究者共同完成的研究,于2024年12月发表在arXiv预印本平台(编号:arXiv:2512

2026/06/30 14:02:08