Lucebox 与 AMD 合作,展示了一种异构消费级硬件配置,其推理速度优于 Nvidia DGX Spark。该系统将 AMD Radeon AI PRO R9700 GPU 与 Strix Halo 处理器相结合,以运行完整的 284B DeepSeek V4 Flash 模型。
- 该配置在完整模型上的解码速度达到 51.1 tok/s。
- 相比单个 Nvidia DGX Spark 单元,其性能优势为 3.63 倍。
- R9700 处理密集路径、热点专家、缓存和草稿模型,而 Strix Halo 在 128GB 内存中管理其他专家以进行并行计算。
- 该配置的成本比购买两台 Nvidia DGX Spark 设备低 $2,899。
作者指出,这是一项实验性实现,运行的是 Q2 模型且上下文为 16k,并计划实施 KVFlash 以支持 64k-128k 的上下文。