开源多模态大模型黑马Molmo Al来袭！部分能力超越GPT-4o和Claude 3.5

创意奇才 10-01 124

默认

摘要： 直播吧月日讯欧足联更换了本周中埃因霍温对葡萄牙体育的欧冠比赛的主裁判原因是原主裁判马雷斯卡被指控在比赛中威胁球员北京时间月日凌晨时欧冠第轮埃因霍温主场迎战葡萄牙体育来源非营利研究机...

直播吧10月1日讯欧足联更换了本周中埃因霍温对葡萄牙体育的欧冠比赛的主裁判，原因是原主裁判马雷斯卡被指控在比赛中威胁球员。北京时间10月2日凌晨3时，欧冠第2轮，埃因霍温主场迎战葡萄牙体育。

（来源：MIT TR）

非营利研究机构艾伦人工智能研究所（简称 Ai2）正在推出名为“Molmo”的开源多模态语言模型，据称该模型的性能可与 OpenAI、Google 和 Anthropic 的专有模型相媲美。

该组织声称，其最大的 Molmo 模型拥有 720 亿个参数，在测量理解图像、图表和文档等内容的中，其性能优于 OpenAI 的 GPT-4o（GPT-4o 拥有超过一万亿个参数）。

与此同时，Ai2 表示，一个较小的 Molmo 模型（拥有 70 亿个参数），其性能接近 OpenAI 最先进的模型，这一成就主要归功于更的数据收集和训练方法。

Ai2 首席执行官 Ali Farhadi 表示，Molmo 表明，开源人工智能开发与封闭的专有模型不相上下。开源模型具有显著的优势，因为它们的开放性意味着其他人可以在其上构建应用程序。Molmo 演示可点击链接查看（https://molmo.allenai.org/），开发人员也可以在 Hugging Face 网站上对其进行修改。（最强大的 Molmo 模型的某些元素仍被屏蔽。）

其他大型多模态语言模型是在包含从互联网上获取的数十亿图像和文本样本的庞大数据集上进行训练的，并且它们可以包含数万亿个参数。Ai2 的高级研究主管 Ani Kembhavi 表示，这个过程给训练数据带来了很多噪音，并随之产生了幻觉。相比之下，Ai2 的 Molmo 模型是在一个更小、更“精心策划”的数据集上进行训练的，该数据集仅包含 60 万张图像，并且具有 10 亿到 720 亿个参数。Kembhavi 表示，这种对高质量数据的关注，而不是不加区别地抓取数据，用更少的资源实现了更好的性能。

Ai2 通过让人类注释者在多页文本上以极其详细的方式描述模型训练数据集中的图像来实现这一目标。他们要求注释者谈论他们所看到的内容，而不是打字。然后，他们使用人工智能技术将语音转换为数据，这使得训练过程更快，同时降低了算力需求。

如果我们想要有效地管理用于人工智能开发的数据，这些技术可能会有用。Hugging Face 的机器学习和社会负责人 Yacine Jernite 表示，他没有参与这项研究。