单机即可部署运行 DeepSeek R1 671B 模型,浪潮信息推出元脑 R1 推理服务器
最新 2 月 12 日消息,浪潮信息今日宣布推出元脑 R1 推理服务器,通过系统创新和软硬协同优化,单机即可部署运行 DeepSeek R1 671B 模型。
最新注:DeepSeek 开源了多版本模型,其中,DeepSeek R1 671B 模型作为全参数基础大模型,相比蒸馏模型具有更强的泛化能力、更高的准确性和更好的上下文理解能力,但也对系统显存容量、显存带宽、互连带宽和延迟提出了更高要求:
在 FP8 精度下至少需要约 800GB 显存承载,FP16 / BF16 精度下需要 1.4TB 以上的显存空间。
此外,DeepSeek R1 是典型的长思维链模型,具有短输入、长输出的应用特点,推理解码阶段依赖更高的显存带宽和极低的通信延迟。
元脑 R1 推理服务器 NF5688G7 原生搭载 FP8 计算引擎,提供 1128GB HBM3e 显存,满足 671B 模型 FP8 精度下不低于 800GB 显存容量的需求,单机支持全量模型推理情况下,仍保留充足的 KV 缓存空间,该机的显存带宽可达 4.8TB/s。
在通信方面,GPU P2P 带宽达 900GB/s,基于最新推理框架单机可支持 20-30 用户并发。同时,单台 NF5688G7 配备 3200Gbps 无损扩展网络,可根据用户业务需求增长实现敏捷扩展,提供 R1 服务器集群 Turnkey 解决方案。
元脑 R1 推理服务器 NF5868G8 是专为大推理模型(Large Reasoning Model)设计的高吞吐推理服务器,业界首次实现单机支持 16 张标准 PCIe 双宽卡,提供最高 1536GB 显存容量,支持在 FP16 / BF16 精度下单机部署 DeepSeek 671B 模型。
该机采用基于 PCIe Fabric 的 16 卡全互连拓扑,任意两卡 P2P 通信带宽可达 128GB/s,降低通信延迟超 60%。通过软硬协同优化,相较传统 2 机 8 卡 PCIe 机型,NF5868G8 可将 DeepSeek 671B 模型推理性能提升近 40%,目前已支持多元 AI 加速卡选配。
相关文章
- OpenAI 周活跃用户达 4 亿,高管称用户“口口相传”发现
- Figure AI 人形机器人多模态能力升级:“听懂”语音指令
- 李开复 AI 公司零一万物被曝多处变动:计划拆分数字人业
- Spotify 启动 AI 配音有声书服务,29 种语言可供选择
- OpenAI GPT-4.5 有望下周发布,GPT-5 被曝将与 o3 大一
- 英伟达推出 Signs 平台:AI 突破美式手语学习,助力连接无
- 传字节大模型团队架构调整,知情人士称吴永辉和朱文佳都
- 清华系团队 DeepSeek 版多模态生物医药大模型 BioMedG
- DeepSeek 还在发力:官宣下周陆续开源 5 个代码库,毫无保
- 报告称 DeepSeek App 上线一个月下载量破亿:几乎没花钱