Gartner预测,到2030年,多模态企业软件和应用将占比达80%,远高于2024年不到10%的水平。
Gartner高级研究总监Roberta Cozza表示:“企业软件向多模态转变是一次企业运营和创新的根本转型。多模态生成式人工智能(GenAI)将带来此前无法实现的特性和功能,推动企业应用的升级演进,医疗、金融、制造等行业都将从中受益。该技术将通过增强特定领域语言模型,提高模型准确性,实现企业运营的自动化并驱动情境决策智能,使AI能够在各种任务中主动采取行动。”
多模态GenAI模型等具有重大影响力的技术位于“Gartner新兴技术影响力雷达图:GenAI”的中心(见图一)。产品负责人必须就投资这些新兴GenAI技术做出关键性决策,从而帮助客户创造前所未有的业务价值。”
图一、新兴技术影响力雷达图:GenAI
数据来源:Gartner(2025年5月)
多模态GenAI能够在单一生成模型中处理多种类型的数据输入和输出,包括图像、视频、音频(语音)、文本和数值数据等。多模态技术使模型能够与各种模态的数据进行交互并生成输出,提高了GenAI的可用性。
目前,许多多模态模型支持两种或三种模态的处理(例如文生视频或语音转图像)。未来几年,多模态能力将进一步扩展,涵盖更多样化和全新的模态类型。
Cozza表示:“企业应专注于将多模态技术整合到其软件中,以此提升用户体验和运营效率。通过充分利用多模态GenAI所提供的多样化数据输入与输出,企业有望释放出全新的生产力与创新潜力。”
好文章,需要你的鼓励
在我们的日常生活中,睡眠的重要性不言而喻。一个晚上没睡好,第二天的工作效率就会大打折扣,而充足的睡眠不仅能让我们恢复精力,还能帮助大脑整理和巩固当天学到的知识。有趣的是,AI模型竟然也表现出了类似的“睡眠需求”。
DeepSeek-AI团队通过创新的软硬件协同设计,仅用2048张GPU训练出性能卓越的DeepSeek-V3大语言模型,挑战了AI训练需要海量资源的传统观念。该研究采用多头潜在注意力、专家混合架构、FP8低精度训练等技术,大幅提升内存效率和计算性能,为AI技术的民主化和可持续发展提供了新思路。
尽管模型上下文协议(MCP)自11月推出以来用户数量快速增长,但金融机构等监管行业仍保持谨慎态度。银行等金融服务公司虽然在机器学习和算法方面是先驱,但对于MCP和Agent2Agent(A2A)系统的采用较为保守。监管企业通常只使用内部代理,因为其API集成需要经过多年审查以确保合规性和安全性。专家指出,MCP缺乏基本构建块,特别是在互操作性、通信标准、身份验证和审计跟踪方面。金融机构需要确保代理能够进行"了解您的客户"验证,并具备可验证的身份识别能力。
加拿大女王大学研究团队首次系统评估了大型视频语言模型的因果推理能力,发现即使最先进的AI在理解视频中事件因果关系方面表现极差,大多数模型准确率甚至低于随机猜测。研究创建了全球首个视频因果推理基准VCRBench,并提出了识别-推理分解法(RRD),通过任务分解显著提升了AI性能,最高改善幅度达25.2%。