Acrab的GΞLIX 1芯片将1000亿参数AI模型带到你的设备上
一家名为Acrab的初创公司刚刚推出了其首款边缘AI芯片GΞLIX 1,并做出了一些大胆的承诺。这款基于5纳米工艺的小型芯片旨在直接在设备上运行高达1000亿参数的AI模型——无需云。
内部构造
GΞLIX 1采用异构计算架构,将20核Arm CPU、3TFLOPS GPU、专用NPU以及音频/视频处理引擎集成在一个芯片上。结果如何?总AI计算能力达到650TOPS。作为对比,高通的Snapdragon X Elite NPU约为45TOPS,英特尔的Core Ultra系列约为40TOPS。这意味着GΞLIX 1的AI性能几乎是这些竞争对手的十倍。
内存与缓存:为大型模型而生
运行1000亿参数的模型并不容易——它需要巨大的内存带宽。Acrab为芯片配备了8MB L1缓存和共享L2缓存,提供768GB/s的带宽。它连接到256位宽的LPDDR5X内存,频率为8533MT/s。这种设置对于大型模型依赖的权重读取和KV缓存访问至关重要,使得本地推理成为可能。
突出的预填充性能
Acrab专注于预填充阶段——模型在处理整个输入后生成第一个令牌的阶段。这直接影响你在输入长查询后看到响应的速度。通过使用向量硬件单元加速Transformer注意力计算,GΞLIX 1在Gemma 26B A4B模型(40k KV缓存,10k令牌输入)测试中实现了每秒1416.8个令牌。这比苹果的M4 Pro Mac Mini快7.5倍。
软件与生态系统
Acrab还发布了完整的软件栈和代理参考设计,涵盖从驱动程序到应用程序框架的所有内容。他们甚至展示了一款名为Agent Box的第一方设备,作为开发人员测试和原型设计的参考实现。
关键点
- 芯片: GΞLIX 1,5纳米工艺,650TOPS AI计算能力
- 能力: 在本地运行高达1000亿参数的AI模型
- 性能: 预填充速度比苹果M4 Pro快7.5倍(Gemma 26B测试)
- 内存: 8MB L1缓存,768GB/s L2带宽,256位LPDDR5X
- 软件: 提供完整软件栈和Agent Box参考设计