器灵 Soulmate
器灵 · 装备

装备选择

直接挑一张外接显卡——接上就能给器灵叠加算力,怎么接、接哪张,下面都配好了。

外挂显卡,为什么能加速?

模型是一层一层算的,像流水线:小主机先算前半段,外接显卡通过一条高速线接力算后半段——两边同时干活,速度就上来了。

第一棒 小主机 · DGX Spark 先算前面几层
第二棒 外接显卡 · 3080 / 6000D 接力算后面几层

RTX 3080 20GB

进阶

预计使算力翻倍

接入方式

通道
OcuLink 直连(PCIe 4.0 ×4 · 约 8 GB/s)
适合场景
大模型 Prefill 与层切流水

性能参数

算力
FP16 59.5 TFLOPS(稠密)
显存
20 GB(扩显存)
带宽
760 GB/s
实测参考
27B 组合 Prefill 1603.20 tok/s(较单卡 +44.03%)

27B 级模型装满一张卡;双机组合的 Prefill、Decode、均衡三档都已验证。

RTX 6000D

旗舰

集群算力 · 长输入主力

接入方式

通道
ConnectX-7 网络(RDMA · 200/400 GbE · 25–50 GB/s)
适合场景
六卡级集群与长输入预填充

性能参数

算力
FP8 276–288 / FP4 547 TFLOPS(公开实测)
显存带宽
1568 GB/s
实测参考
双机 8K Prefill 8157.74 tok/s
集群参考
六卡 Prefill 16000+ tok/s

长输入预填充主力;与 DGX Spark 组双机或六卡集群。

数据来源:Halo-lab · 异构 GPU PD 实验室(稠密加速实测)与公开硬件规格;带「预计」的数值以实际部署为准。