通用大模型可以在100个场景中,解决70%-80%的问题,但未必能100%满足企业某个场景的需求。
预训练模型也就是我们常说的通用大模型,它的训练数据都是大规模低成本获取的,所以通过训练得出的是某种共性能力。目前市场上有非常多的预训练模型,像GPT、LLaMA2等。
预训练模型用学习阶段来类比就好比高中,达到了一个平均水平,但是如果想要在特定领域有更好水平,就需要进一步进修到大学,也就是要在预训练模型上提供更多某领域的知识进行精调训练。
这也是为什么,从今年3月开始国内出现了“百模”大战的原因。《中国人工智能大模型地图研究报告》显示,截至2023年5月底,国内10亿级参数规模以上基础大模型至少已发布79个。2023世界人工智能大会(WAIC2023)上,国内外30余款大模型集中亮相。
“大模型”已经成为业界谈论的高频词,而且也呈现出向垂直领域“小而精”发展的态势。游戏、影视传媒、办公、医疗、金融、电商、广告、ERP、工业、家居等领域已经出现了基于行业大模型的相关应用。
行业大模型参数相对通用大模型更少,在推理和训练上的成本也更低,但是想要让大模型在行业中落地,并不是简单的通用模型加上行业数据就可以实现的。
首先需要将行业中分散的数据集中,其次拥有稳定的训练环境,最后训练上提供高效的算力调度和利用。综合看来不仅要有技术,还要让技术和行业应用场景结合,最后平衡成本、效率和体验,才能真正将行业大模型落地。
本期数字化转型方略也寻找到行业大模型中的参与者,他们分享了自己的行业大模型是如何实现,以及已经落地的场景和案例。同时我们也看到很多企业正在将行业大模型的能力开放出来,让更多的企业可以受惠。
可以预见,未来每一个企业都能拥有属于自己的大模型。
《数字化转型方略》2023年第9期:http://www.zhiding.cn/dxinsight/2309
好文章,需要你的鼓励
IBM Spyre加速器将于本月晚些时候正式推出,为z17大型机、LinuxONE 5和Power11系统等企业级硬件的AI能力提供显著提升。该加速器基于定制芯片的PCIe卡,配备32个独立加速器核心,专为处理AI工作负载需求而设计。系统最多可配置48张Spyre卡,支持多模型AI处理,包括生成式AI和大语言模型,主要应用于金融交易欺诈检测等关键业务场景。
加拿大女王大学研究团队首次对开源AI生态系统进行端到端许可证合规审计,发现35.5%的AI模型在集成到应用时存在许可证违规。他们开发的LicenseRec系统能自动检测冲突并修复86.4%的违规问题,揭示了AI供应链中系统性的"许可证漂移"现象及其法律风险。
意大利初创公司Ganiga开发了AI驱动的智能垃圾分拣机器人Hoooly,能自动识别并分类垃圾和可回收物。该公司产品包括机器人垃圾桶、智能盖子和废物追踪软件,旨在解决全球塑料回收率不足10%的问题。2024年公司收入50万美元,已向谷歌和多个机场销售超120台设备,计划融资300万美元并拓展美国市场。
这项由剑桥大学、清华大学和伊利诺伊大学合作的研究首次将扩散大语言模型引入语音识别领域,开发出Whisper-LLaDA系统。该系统具备双向理解能力,能够同时考虑语音的前后文信息,在LibriSpeech数据集上实现了12.3%的错误率相对改进,同时在大多数配置下提供了更快的推理速度,为语音识别技术开辟了新的发展方向。