V-Help
← 全部新闻
人工智能

苹果突破设备端AI代理内存限制

苹果突破设备端AI代理内存限制

图片: images.ctfassets.net

简要回答

苹果发布AFM 3架构,通过将AI模型权重存储在NAND闪存而非DRAM中,实现设备端运行200亿参数模型。

苹果发布了一项突破性的设备端AI解决方案,突破了关键限制——RAM容量不足。在WWDC26大会上,公司宣布推出AFM 3模型系列,该系列由苹果与Google联合开发。产品线包括两款本地模型和三款云端模型,均在Private Cloud Compute架构下运行。其中最引人注目的是AFM 3 Core Advanced——一款200亿参数模型,其权重存储于NAND闪存而非DRAM。

传统方法要求整个模型驻留在RAM中,限制了设备端模型规模。苹果的新架构颠覆了这一模式:权重存储于闪存,仅在处理时将必要模型段加载至DRAM。这一创新由Instruction-Following Pruning(IFP)机制驱动,该机制在查询阶段而非每个token阶段识别所需专家。

该架构可根据任务复杂度动态扩展活跃参数,从10亿至40亿不等。简单操作使用最小参数集,复杂任务则从总池200亿参数中调用最多40亿。然而,苹果尚未披露完整细节:能效、热性能及自动云端切换标准仍不明确,相关技术报告计划于今年夏天发布。

对企业而言,这开辟了AI代理部署的新可能性。公司现在可在本地运行强大模型,摆脱云端依赖——对数据控制要求严格的行业尤为关键。复杂任务可自动转至Google Cloud的Nvidia GPU云端模型AFM 3 Cloud Pro。然而,本地与云端模型切换标准不明确,为需记录推理执行位置的组织带来合规困难。

常见问题

苹果AFM 3架构解决了什么问题?
新的AFM 3架构解决了设备端AI模型DRAM容量不足的问题。此前,大型模型无法装入RAM,限制了其能力。现在,权重存储于NAND闪存,仅在处理时将必要部分加载至DRAM。
AFM 3 Core Advanced的路由机制如何工作?
在AFM 3 Core Advanced中,路由机制每次查询仅执行一次,而非每个token。模型识别查询所需的专家(模型段),将其加载至DRAM,并用于生成所有token。这减轻了内存负载并加速推理。
AFM 3为企业带来哪些优势?
企业可在本地部署强大AI代理,无需依赖云端,对数据控制要求高的行业尤为关键。复杂任务可自动转至Google Cloud的Nvidia GPU云端模型AFM 3 Cloud Pro。但本地与云端模型切换标准不明确,为需记录推理执行位置的组织带来合规挑战。
分享:

Dzen 订阅: /feed/dzen.xml · RSS: /feed.xml

为何可信

本文由 V-Help 编辑部根据一手来源整理,并标注发布日期。

发布: V-Help.ru 新闻编辑部

来源: VentureBeat