Colibrì:在普通硬件上运行巨型AI模型的创新方案

图片: Tom's Hardware
简要回答
Colibrì是一个概念验证项目,使1.5TB GLM-5.2 AI模型能在配备25GB RAM和CPU的PC上运行。该技术采用动态模型分段加载(MoE),以牺牲速度换取可及性,并…
意大利工程师Vincenzo(网名JustVugg)推出了名为Colibrì的概念验证项目,使1.5TB的GLM-5.2语言模型能在标准PC上运行。该系统仅需25GB RAM、一颗CPU和一块1GB/秒的虚拟NVMe驱动器。这一解决方案为渴望使用强大AI模型但无力投资昂贵服务器硬件(如Nvidia NVL72)的爱好者和开发者开辟了新的可能性。
GLM-5.2是一款专家混合(MoE)架构的模型,拥有7440亿参数,其响应质量可与OpenAI和Anthropic等领先公司的解决方案媲美。然而,受限于硬件资源,Colibrì的令牌生成速度仅为每秒0.05–0.1个令牌,无法用于实时应用。相比之下,专业系统可实现每秒20–30个令牌的输出。
Colibrì的工作原理是动态将模型的必要部分加载到RAM中。在MoE架构中,每个查询片段由独立的“专家”(即专业化的子模型)处理。Colibrì并非加载整个模型,而是仅加载处理当前令牌所需的专家。这降低了内存需求,但给系统I/O和CPU性能带来了显著压力。
目前,该项目仍处于实验阶段,尚不支持GPU,但即使使用GPU加速,数据传输速度仍将是主要瓶颈。开发者正积极收集数据以优化性能,并邀请社区参与测试。未来,Colibrì有望成为在高性能消费级硬件上运行先进AI模型的基础。
常见问题
- 什么是Colibrì,它的用途是什么?
- Colibrì是一个实验性项目,旨在在资源有限的标准硬件上运行大型AI模型。它降低了使用先进语言模型的门槛,无需昂贵的GPU或服务器解决方案。
- Colibrì支持哪种模型,其规格如何?
- Colibrì支持GLM-5.2模型,该模型包含7440亿参数,占用1.5TB存储空间。这种专家混合(MoE)模型在响应质量上可与OpenAI和Anthropic的解决方案竞争。
- 为什么Colibrì的运行速度如此之慢?
- 该项目仅将模型必要部分加载到RAM中,导致频繁的读写操作并形成性能瓶颈。主要限制包括NVMe驱动器速度、RAM带宽和CPU性能。
分享:
Dzen 订阅: /feed/dzen.xml · RSS: /feed.xml