RTX 3080 20GB
进阶预计使算力翻倍
接入方式
- 通道
- OcuLink 直连(PCIe 4.0 ×4 · 约 8 GB/s)
- 适合场景
- 大模型 Prefill 与层切流水
性能参数
- 算力
- FP16 59.5 TFLOPS(稠密)
- 显存
- 20 GB(扩显存)
- 带宽
- 760 GB/s
- 实测参考
- 27B 组合 Prefill 1603.20 tok/s(较单卡 +44.03%)
27B 级模型装满一张卡;双机组合的 Prefill、Decode、均衡三档都已验证。
直接挑一张外接显卡——接上就能给器灵叠加算力,怎么接、接哪张,下面都配好了。
模型是一层一层算的,像流水线:小主机先算前半段,外接显卡通过一条高速线接力算后半段——两边同时干活,速度就上来了。
预计使算力翻倍
接入方式
性能参数
27B 级模型装满一张卡;双机组合的 Prefill、Decode、均衡三档都已验证。
集群算力 · 长输入主力
接入方式
性能参数
长输入预填充主力;与 DGX Spark 组双机或六卡集群。
数据来源:Halo-lab · 异构 GPU PD 实验室(稠密加速实测)与公开硬件规格;带「预计」的数值以实际部署为准。