跳转到主要内容

Acrab的GΞLIX 1芯片让你本地运行100B参数AI模型

Acrab的GΞLIX 1:在边缘运行1000亿参数AI模型

一家名为Acrab的初创公司正式推出了其首款边缘AI系统级芯片GΞLIX 1。该芯片采用5nm工艺,旨在实现一个引人注目的指标:支持高达1000亿参数的大语言模型本地运行,无需将数据发送到云端。

硬件:异构性能猛兽

GΞLIX 1采用异构计算架构,将20核Arm CPU、3 TFLOPS GPU、专用NPU以及音视频处理引擎集成在单芯片中。总AI算力达到650 TOPS。作为对比,高通骁龙X Elite NPU约为45 TOPS,英特尔酷睿Ultra系列NPU约为40 TOPS。GΞLIX 1的AI性能大约是这些竞品的十倍。

为满足大模型推理对内存的庞大需求,缓存和内存子系统专为高吞吐量设计。芯片配备8 MB L1缓存,共享768 GB/s的L2缓存带宽,并连接256位宽的LPDDR5X内存,频率8533 MT/s。在大模型推理时,权重读取和KV缓存访问对内存带宽极为敏感,这一配置为在边缘运行100B模型提供了基础。

性能:聚焦预填充

Acrab展示了预填充阶段的性能——即模型在接收用户输入后、开始逐token生成输出前,对整个输入进行完整编码的过程。预填充速度直接决定了长文本输入的首token延迟。Acrab使用向量硬件单元加速Transformer注意力机制,并对预填充路径进行了针对性优化。官方测试中,在Gemma 26B A4B配置、40k KV缓存和10k token输入下,芯片达到1416.8 tokens/s,比苹果M4 Pro Mac Mini快7.5倍。

软件与生态系统

软件方面,Acrab发布了完整的软件栈和智能体参考设计,涵盖从底层驱动到上层应用框架。公司还推出了首款终端设备Agent Box,作为GΞLIX 1的参考实现,供开发者评估和原型开发。

关键点

  • 芯片: GΞLIX 1,5nm工艺,650 TOPS AI算力
  • 架构: 异构,含20核Arm CPU、3 TFLOPS GPU、专用NPU
  • 内存: 8 MB L1缓存,768 GB/s L2带宽,256位LPDDR5X @ 8533 MT/s
  • 性能: 预填充1416.8 tokens/s(Gemma 26B A4B),比苹果M4 Pro快7.5倍
  • 软件: 全栈,包括驱动、框架和Agent Box参考设计