天天模拟器致力于打造安全、高速、放心的专业下载站!
当前位置 : 首页 > 资讯 > DeepSeek推理性能分析:NV华为最优AMD实现100x提升

DeepSeek推理性能分析:NV华为最优AMD实现100x提升

2026-06-25 12:47:48 来源:天天模拟器 作者:文章来自于网络

作为开源AI大模型的核心力量,DeepSeek V4的发布不仅仅是增加了一个新模型,更是对各大AI生态系统的一次严峻考验。谁能最先支持DeepSeek V4,谁的生态就能获得更大的竞争优势。

最近,SemiAnalysis发布了一篇详细分析,评估了V4的推理性能,并对比了当前主流的AI生态系统,包括NVIDIA、华为、AMD及其各自的平台CUDA、ROCm、CANN,以及第三方社区提供的开源方案。

综合来看,目前表现最出色、最优化的是NVIDIA的CUDA平台上的vLLM和SGLang框架。V4在发布当天就能实现Day0支持,即便是最新的硬件如GB200/300,也能达到开箱即用的水平。

华为的昇腾生态在这一方面也不逊色于CUDA。昇腾950DT搭配CANN框架同样在发布当天提供了Day0支持,在硬件和软件层面都能实现全栈适配。

这两个生态系统目前是最优的。要明白,无论过去还是现在的国内外大模型,通常只有NVIDIA的CUDA生态系统能做到Day0全栈支持。显然,V4在开发阶段就针对国产AI平台进行了专门优化和适配,这一点也确实得到了验证。

AMD的硬件和ROCm生态在指标上表现不俗,但在V4的Day0支持上却遭遇了困难。MI355X显卡初期只能运行FP8模式,性能表现不佳。不过,AMD的SGLang团队迅速跟进,在短短26天内将性能提升了100倍。

根据SemiAnalysis的分析,NVIDIA的CUDA生态系统无疑是最稳定的,Day0支持毫无悬念,并且还受益于最新硬件的加持,GB300的Token成本在计算后仍然相当低廉。

华为的昇腾配合CANN生态系统也能够实现类似NVIDIA那样的Day0支持,这一点让人眼前一亮,标志着国产AI平台取得了重大进展。不过,与NVIDIA相比,国产AI的算力仍受到限制,硬件性能上存在不小的差距。

AMD方面,其硬件和软件在纸面上都很强大,但生态系统的完善程度仍有不足。然而,起点低的好处是进步空间巨大,100倍的性能提升听起来非常震撼,只是取决于客户是否喜欢这种发展节奏。

来源:快科技

  • 热门游戏榜
  • 最新游戏榜