V-Help
← 全部新闻
人工智能

初创公司寻求大语言模型的Transformer替代方案

初创公司寻求大语言模型的Transformer替代方案

图片: MIT Technology Review

简要回答

初创公司正在开发超越Transformer的LLM架构,以解决高能耗与有限上下文处理能力的问题。

作为现代大语言模型(LLM)核心的Transformer架构已无法满足行业日益增长的需求。其关键机制——密集注意力(dense attention)——虽保证高精度,却需耗费海量计算资源。例如,处理包含1万字的文档可能需执行高达5000万次乘法运算,这使模型能耗高昂且成本巨大。

据OpenAI总裁格雷格·布罗克曼透露,该公司今年计划投入500亿美元用于计算资源。国际能源署预测,到2030年数据中心用电量将翻倍。这些数据凸显寻找替代方案的迫切性。

Transformer架构的上下文窗口限制进一步加剧了问题。模型难以同时处理大量数据,这对需分析整个文档库或代码库的任务构成严重阻碍。Subquadratic等初创公司看到了这一机遇,正积极研发新架构,以突破现有瓶颈。

LLM市场正酝酿变革,不受现有技术束缚的公司有望成为新一代模型的领导者。成功的关键在于提供比当前Transformer更高效且经济的解决方案。

* Facebook、Instagram、WhatsApp等Meta旗下服务属于Meta Platforms Inc.,其在俄罗斯境内被认定为极端主义组织并被禁止。

常见问题

为什么Transformer架构正在过时?
Transformer架构在处理长文本时需消耗巨量计算资源,导致高能耗与有限上下文窗口,严重制约复杂任务(如大规模数据分析)的执行效率。
有哪些初创公司正在研发Transformer替代方案?
Subquadratic等公司正在探索新的模型架构,以突破Transformer的固有限制。其目标是构建更高效、可扩展的AI解决方案。
新技术将为LLM带来哪些优势?
替代方案有望降低能耗、提升数据处理速度并扩展上下文窗口,使AI能处理更复杂任务,如分析整个文档库或代码库。
分享:

Dzen 订阅: /feed/dzen.xml · RSS: /feed.xml

为何可信

本文由 V-Help 编辑部根据一手来源整理,并标注发布日期。

发布: V-Help.ru 新闻编辑部

来源: MIT Technology Review