RTX 5090 移动版碾压 M5 Max:生成速度最高快 1.3 倍,但大模型面前光环褪色

2026/08/21 06:58AI云资讯14006

(AI云资讯消息)英伟达移动版 RTX 5090 拥有充足的显存容量,足以在最具硬件杀手级水准的 3A 大作中拉满所有画质选项。然而,当面对 AI 工作负载时,这块 GPU 的 24GB 帧缓冲内存则进入了完全不同的竞争维度。一系列测试表明,RTX 5090 在面对苹果 M5 Max 时仍能站稳脚跟,在多项大语言模型任务中全面领先。不过,这一优势仅限于常规负载,一旦基准测试切换到更重的 AI 模型并同步增大上下文长度,局面便会随之逆转。

在 Alex Ziskind 的最新对比测试中,新款雷蛇灵刃 18 与苹果 16 英寸 MacBook Pro(M5 Max)展开全面较量,项目涵盖各类 AI 任务。首轮测试运行 4-bit 量化的 Qwen3 4B 模型,上下文长度高达 262,144。结果显示,RTX 5090 空有图形算力却难以施展——24GB 显存几乎被耗尽,生成速度仅为 25.28 token/秒。

作为参照,M5 Max 在同测试中取得了 181.40 token/秒的成绩。但当上下文长度降至 68,014 后,RTX 5090 得以释放大量被占用的显存,生成速度跃升至 160.36 token/秒。不过即便如此,它依然未能超越 M5 Max,原因很可能在于软件层面的差异:Windows 端使用的是 LM Studio,而苹果 Silicon 端则调用了 MLX 框架。

好在 RTX 5090 并未就此认输。YouTuber 随后测试了 Gemma 4 12B、Qwen3.5 27B 和 Qwen3.6 35B A3B 等多款模型(基于 llama.cpp),在提示处理和token生成两方面,RTX 5090 均反超 M5 Max。不过必须指出的是,英伟达这款移动旗舰 GPU 之所以能称霸,前提始终是那 24GB 显存尚未触顶。

但很遗憾,一旦面对像 Qwen3.5 122B 这样的超大规模稠密模型,RTX 5090 几乎没有任何胜算。反观 M5 Max,凭借 128GB 统一内存,即便在消耗 94GB 内存的情况下,仍能维持 139 token/秒的提示处理速度和 47.4 token/秒的生成速度。

相关文章

AI企业

更多>>

AI硬件

更多>>

AI产业

更多>>

AI技术

更多>>
AI云资讯(爱云资讯)立足人工智能科技,打造有深度、有前瞻、有影响力的泛科技信息平台。
合作QQ:1211461360微信号:icloudnews