特斯拉发布D1 AI芯片:500亿晶体管、400W热设计功耗
2021-08-22 21:20:28AI云资讯1609
近日的特斯拉AI日活动上,特斯拉公布了最新的AI训练芯片“D1”,规模庞大,令人称奇。
该芯片采用台积电7nm工艺制造,核心面积达645平方毫米,仅次于NVIDIA Ampere架构的超级计算核心A100(826平方毫米)、AMD CDNA2架构的下代计算核心Arcturus(750平方毫米左右),集成了多达500亿个晶体管,相当于Intel Ponte Vecchio计算芯片的一半。
其内部走线,长度超过11英里,也就是大约18公里。

它集成了四个64位超标量CPU核心,拥有多达354个训练节点,特别用于8×8乘法,支持FP32、BFP64、8、INT16、INT8等各种数据指令格式,都是AI训练相关的。
特斯拉称,D1芯片的FP32单精度浮点计算性能达22.6TFlops(每秒22.6万亿次),BF16/8计算性能则可达362TFlops(每秒362万亿次)。
为了支撑AI训练的扩展性,它的互连带宽非常惊人,最高可达10TB/s,由多达576个通道组成,每个通道的带宽都有112Gbps。
而实现这一切,热设计功耗仅为400W。

特斯拉D1芯片可通过DIP(Dojo接口处理器)进行互连,25颗组成一个训练单元(Training Tile),而且多个训练单元可以继续互连,单个对外带宽高达36TB/s,每个方向都是9TB/s。
如此庞然大物,耗电量和发热都是相当可怕的,电流达18000A,覆盖一个长方体散热方案,散热能力高达15kW。



特斯拉展示了实验室内部的一个训练单元,运行频率2GHz,计算性能最高9PFlops(每秒9千万亿次)。

特斯拉还用D1芯片,打造了一台AI超级计算机“ExaPOD”,配备120个训练单元、3000颗D1芯片、1062000个训练节点,FP16/8训练性能峰值1.1EFlops(每秒110亿亿次计算)。
建成后,它将是世界上最快的AI超算,对比特斯拉现在基于NVIDIA方案的超算,成本差不多,但拥有4倍的性能、1.3倍的能效比、1/5的体积。


相关文章
- 国产人形机器人最新进程,这家公司的产品要比肩特斯拉Optimus!!!
- AI芯片竞争战火升级,特斯拉/Meta/微美全息自研硬核实力发起行业冲锋革命!
- 特斯拉营收再度增长,首座大型擎天柱机器人生产工厂的筹备工作即将启动
- 特斯拉公布2026年第一季度产销数据,销量略有回升
- 前特斯拉团队杨硕创业首作登顶 SOTA:妙动科技使机器人控制效率提升10倍
- 英伟达AI智能工厂宏图再掀热潮!特斯拉/微美全息自研芯片加固AI云计算护城河!
- 三星助力特斯拉开启AI5芯片量产,微美全息(WIMI.US)紧跟步伐抢占AI云计算基地!
- “两轮特斯拉”OMOWAY官宣机器人架构,多用途轮式机器人亮相
- 特斯拉全自动驾驶功能已处于召回边缘
- 2026年迎量产商业化关键节点,特斯拉与微美全息持续强化机器人产业领跑地位!
- 英伟达已瞄准台积电1.6nm产能,特斯拉/微美全息加速扩展AI芯片集群生态!
- 腾讯与特斯拉共同升级座舱体验,正式上线微信互联与目的地服务
- AI浪潮汹涌芯片突围战打响!英伟达/特斯拉/微美全息竞速引领基建突破新高度!
- 特斯拉迎来严峻里程碑:连续第二年业绩下滑
- 特斯拉宣布即将推出量产版第三代擎天柱人形机器人
- 特斯拉将停产Model S和Model X,为擎天柱机器人腾出产能空间
人工智能企业
更多>>人工智能硬件
更多>>人工智能产业
更多>>人工智能技术
更多>>- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠
- Seedance 2.0面向企业公测,豆包大模型日均Token使用量突破120万亿
- 端到端OCR模型第一!百度千帆Qianfan-OCR正式发布
- 云知声Unisound U1-OCR大模型发布!首个工业级文档智能基础大模型,开启OCR 3.0时代
- 基石智算上线 MiniMax M2.5,超强编程与智能体工具调用能力
- 昇腾原生支持,科学多模态大模型Intern-S1-Pro正式发布并开源
- 百度千帆深度研究Agent登顶权威评测榜单DeepResearch Bench
- 在MoltBot/ClawdBot,火山方舟模型服务助力开发者畅享模型自由









