测试
成功案例——智能计算中心定制人工智能服务器项目

案例背景
2024年,某智慧计算中心需要部署一套高性能、高可靠性且完全国产(中国制造)的AI计算平台。该平台经过专门优化,能够高效运行全系列DeepSeek模型,同时降低部署成本。当时,市场上的服务器主要配置为8GPU。然而,客户要求的是一套能够支持16GPU并具备高速GPU间互连的单系统解决方案,同时还要具备未来扩展至32GPU的可扩展性。为了应对这一挑战,我们设计了一套集成式AI计算解决方案,该方案包含一个核心的16GPU BOX单元和一个前置式2U机架服务器。
客户痛点
- 01
灵活配置
配置灵活,可扩展性强,未来可扩展为小规模 GPU 集群。
- 02
降低成本
在不影响性能的前提下,单个 16 GPU 系统比两个独立的 8 GPU 服务器具有更具竞争力的成本优势。
- 03
全栈式国内适配
核心部件本地化,与国内操作系统和大型平台完美兼容。
- 04
灵活配置
配置灵活,可扩展性强,未来可扩展为小规模 GPU 集群。
- 05
降低成本
在不影响性能的前提下,单个 16 GPU 系统比两个独立的 8 GPU 服务器具有更具竞争力的成本优势。
- 06
全栈式国内适配
核心部件本地化,与国内操作系统和大型平台完美兼容。
解决方案
麦村信息技术为该智能计算中心量身定制了一套人工智能计算解决方案,采用核心16GPU BOX主机搭配前置式2U机架服务器。该方案全面优化了计算能力、通信能力、存储能力和管理能力,并与DeepSeek全套模型的私有部署完美兼容。核心配置如下:

核心计算节点:
16卡GPU扩展盒(4U机架式)
配备 16 张 MetaX MXC500 计算卡,提供 3.84 PFLOPS 的 FP16 超高计算能力,搭配 1024GB HBM2e 视频内存和 1.8 TB/s 视频内存带宽。
· 16 GPU互连
支持 4/8/16 卡对卡互连(MetaxLink 34GB/s),采用创新拓扑结构,实现 300% 的 GPUxCCL 通信带宽,并有效支持 MOE 和密集型模型;
· 超低延迟无损直连架构
采用无损通信设计,网络、NVMe 存储和 GPU 之间直接连接,消除数据交互延迟;
· 多路径 PCIe 交换机扩展,实现高带宽优化
本地支持 8 个 PCIe 交换机直接连接 NVMe SSD,网络兼容 4 个 PCIe 交换机,可实现通过融合以太网 (RoCE) 直接连接 100G/200G/400G InfiniBand (IB)/RDMA;
支持节点:
前置式 2U 机架服务器
配备两颗海刚C86-4G 7400系列处理器,支持高达8TB DDR5 ECC内存,为计算节点提供强大的计算能力;
· 丰富的扩展和存储能力
支持 PCIe 标准卡、OCP 卡(10G/100G/200G 网络)
· 支持多种磁盘外形尺寸
本地存储兼容多种规格硬盘的混合安装,支持所有 RAID 模式;
· 冗余冷却系统,确保硬件可靠性
配备 1+1 冗余电源和四个热插拔风扇,构成具有核心节点的高可靠性硬件系统。


全栈式国内适配
这款 4U 16 卡 GPU 机箱可提供 3.84 PFLOPS FP16 运算能力、1024GB HBM2e 显存以及低延迟互连,适用于高性能 AI 工作负载。
· 全栈式国内研发
核心部件完全独立设计和本地化,与国内操作系统和大型平台完美兼容。
· 本地部署模式
支持对全系列 DeepSeek 模型进行私有部署,实现从硬件到软件的独立可控系统。
实施效果
智能计算中心投入运行后,成功搭建了本地化高算力大模型智能计算平台,其核心业务指标实现了跨越式提升,全面满足本地化大模型全场景应用需求。
· 大型模型运行能力取得突破:
单个节点即可高效运行完整版 DeepSeek-R1(671B),显著降低部署成本。DeepSeek 32B 和 70B 精简模型的推理效率提升了 50%。
· 提高计算能力协调效率:
16 卡高密度计算设计使计算能力利用率提高了 60% 以上。灵活的 GPU 互连模式和解耦架构可按需分配计算资源,从而使大型模型微调效率提高了 40% 以上。
· 硬件可靠性最大化:
电源和风扇采用高冗余设计,使平台可用性达到99.99%,支持7×24小时不间断稳定运行。单个组件故障不会影响整个系统的正常运行。

用户评价
16 卡 GPU BOX 智能计算解决方案完美地解决了我们现有计算能力平台的诸多痛点,在计算能力规模和运行效率方面实现了双重升级。
·01 最大单节点计算性能
单个节点即可高效运行完整版的 DeepSeek-R1 大型模型,显著降低大型模型的部署成本。
· 02 自主研发的国内基础
核心组件已实现完全本地化,使计算能力基础真正实现了自主、可控和数据安全。
· 03 本地数据安全
安全的底层架构强制执行严格的本地数据隔离和存储,从而为信息安全建立强大的防御体系。
·04 高速、低延迟互连
该方案采用无损通信拓扑结构和高速卡互连设计,彻底消除了大型模型训练和微调过程中的通信延迟。推理效率的提升也使我们能够更好地为地方政府企业机构和科研机构提供计算服务。
· 05 一体化集成计算
麦村的一体化解决方案兼顾了计算能力、可靠性和可扩展性,同时具有出色的成本效益,为区域人工智能产业的实施奠定了坚实的计算能力基础。
· 06 降低总拥有成本 (TCO)
结合简化的硬件部署,这种方法有效地降低了大型模型实施所需的总体投资。
