為分散式訓練與大規模推論規劃 H100、H200、B200 或 B300 配置,從工作負載出發,評估 8、16、32 張以上 GPU。
確認 GPU 版本、每卡顯存、CPU、RAM 與實際 GPU 互連;型號名稱不能取代拓撲確認。
依訓練或推論方案評估網路頻寬、RDMA 支援、共用儲存與排程需求。
確認部署區域、驗證標準、租期與支援範圍。供應容量與服務等級須以書面約定。