苹果突破设备端AI代理内存限制

简要回答
苹果发布AFM 3架构,通过将AI模型权重存储在NAND闪存而非DRAM中,实现设备端运行200亿参数模型。
苹果发布了一项突破性的设备端AI解决方案,突破了关键限制——RAM容量不足。在WWDC26大会上,公司宣布推出AFM 3模型系列,该系列由苹果与Google联合开发。产品线包括两款本地模型和三款云端模型,均在Private Cloud Compute架构下运行。其中最引人注目的是AFM 3 Core Advanced——一款200亿参数模型,其权重存储于NAND闪存而非DRAM。
传统方法要求整个模型驻留在RAM中,限制了设备端模型规模。苹果的新架构颠覆了这一模式:权重存储于闪存,仅在处理时将必要模型段加载至DRAM。这一创新由Instruction-Following Pruning(IFP)机制驱动,该机制在查询阶段而非每个token阶段识别所需专家。
该架构可根据任务复杂度动态扩展活跃参数,从10亿至40亿不等。简单操作使用最小参数集,复杂任务则从总池200亿参数中调用最多40亿。然而,苹果尚未披露完整细节:能效、热性能及自动云端切换标准仍不明确,相关技术报告计划于今年夏天发布。
对企业而言,这开辟了AI代理部署的新可能性。公司现在可在本地运行强大模型,摆脱云端依赖——对数据控制要求严格的行业尤为关键。复杂任务可自动转至Google Cloud的Nvidia GPU云端模型AFM 3 Cloud Pro。然而,本地与云端模型切换标准不明确,为需记录推理执行位置的组织带来合规困难。
常见问题
- 苹果AFM 3架构解决了什么问题?
- 新的AFM 3架构解决了设备端AI模型DRAM容量不足的问题。此前,大型模型无法装入RAM,限制了其能力。现在,权重存储于NAND闪存,仅在处理时将必要部分加载至DRAM。
- AFM 3 Core Advanced的路由机制如何工作?
- 在AFM 3 Core Advanced中,路由机制每次查询仅执行一次,而非每个token。模型识别查询所需的专家(模型段),将其加载至DRAM,并用于生成所有token。这减轻了内存负载并加速推理。
- AFM 3为企业带来哪些优势?
- 企业可在本地部署强大AI代理,无需依赖云端,对数据控制要求高的行业尤为关键。复杂任务可自动转至Google Cloud的Nvidia GPU云端模型AFM 3 Cloud Pro。但本地与云端模型切换标准不明确,为需记录推理执行位置的组织带来合规挑战。
分享:
Dzen 订阅: /feed/dzen.xml · RSS: /feed.xml