法国初创公司Kog将标准GPU上的AI模型推理速度提升30倍

图片: TechCrunch
简要回答
法国初创公司Kog开发软件,将标准GPU上的LLM推理速度提升高达30倍。该技术通过优化内存和计算资源利用率,降低成本并提升效率。
法国初创公司Kog带着雄心勃勃的目标进入市场:证明数据中心常用的标准GPU能够比预期更高效地处理大型语言模型(LLM)的推理任务。今年5月,该公司展示了其技术,使用20亿参数的小型模型Laneformer 2B实现了每秒3000个令牌的处理速度。Kog创始人兼CEO加埃尔·德拉洛表示,类似的优化也适用于大型模型,可能彻底改变AI基础设施的部署方式。
Kog专注于软件优化,以充分挖掘现有硬件的潜力。德拉洛指出,许多公司在使用Anthropic的Claude等模型时面临延迟问题,等待结果可能长达数小时。该初创公司已吸引了200多家潜在客户,包括游戏和应用开发商,因为生成速度直接影响其收入。近期目标是将大型模型的推理速度提升10倍,这将成为吸引A轮融资的关键因素。
Kog的方法基于对GPU架构的深入分析和底层优化。该公司创始人曾在网络安全领域工作,并参与逆向工程竞赛,将此经验应用于软件开发。然而,这种方法耗时较长:为每款新芯片适配技术需数周甚至数月。未来,Kog计划通过代理系统实现流程自动化,以扩大对模型和硬件的支持。
市场上已有竞争对手,如法国初创公司ZML,提供与硬件无关的推理加速软件。但Kog将自身定位为更接近斯坦福大学Hazy Research实验室等科研项目的技术开发者。来自欧洲投资者(包括Bpifrance和Scaleway)的支持,凸显了该项目对提升区域技术独立性的战略意义。
常见问题
- 什么是AI中的推理?
- 推理是指已训练的AI模型根据输入数据生成答案或预测的过程。对于LLM而言,即生成文本。
- 为什么GPU上推理速度的提升对企业至关重要?
- 快速推理能减少AI模型处理时的延迟,对实时应用至关重要,同时降低运营成本并提升解决方案的竞争力。
- Kog目前支持哪些GPU?
- 目前Kog在AMD MI300X和Nvidia H200 GPU上测试其技术,未来计划支持更多芯片。
分享:
Dzen 订阅: /feed/dzen.xml · RSS: /feed.xml