“我们需要更大的GPU。”
当地时间3月18日, 黄仁勋于英伟达2024 GTC大会之上, 宣告了英伟达那新一代的加速计算平台NVIDIA Blackwell, 以及基于Blackwell GPU架构的双芯片GPU B200, 还有超级芯片GB200。
Blackwell架构, 单GPU的AI性能, 达到了20 PFLOPS, 性能相较于上一代而言, 提高幅度为5倍, 成本以及能耗下降, 降低幅度为25倍。黄仁勋, 以训练1.8万亿参数的GPT模型作为例子, 此模型参数量有可能是GPT-4的参数量。同样以90天作为训练周期, 上一代Hopper架构的GPU, 至少需要用到8000个, 功耗为15MW, 然而使用Blackwell架构的GPU, 仅仅只需要2000颗, 功耗约为4 MW。

Blackwell
身为全球加速计算市场里被称作“老大”的英伟达, 其今日所拥有的全部成功, 皆是构建于GPU之上的。
然而, 就黄仁勋于GTC大会之上所作的主题演讲而言, 英伟达好像并不期望外界仅仅瞧见他们的GPU。于黄仁勋长达2个小时的主题演讲期间, 虽说Blackwell平台的发布堪称绝对主角, 可是他还将超过一半的演讲时长置于GPU“周边”的技术领域, 其中涵盖: 芯片设计、生产技术,生成式AI模型训练, 数字孪生, 以及具身智能等等。
长久以来, 英伟达始终在着重表明自身是“于人工智能时代占据领先位置的计算公司”, 并非仅仅只是一家芯片公司, 也不是单纯的硬件公司。在GTC上所宣布的软件技术, 在GTC上所宣布的AI训练技术, 在GTC上所宣布的机器人技术等, 同样都隐隐透露出“源自GPU, 却高于GPU”的意味。
软件是GPU的护城河
加速计算市场之中, 并非缺少性能跟英伟达相近的GPU产品, 可是呢, 英伟达真正的护城河, 实际上是源自GPU软件开发工具。
英伟达在Blackwell范围以外, 公布了一系列跟AI、GPU、机器人有关的创新软件应用, 其中涵盖了哪些呢, 并且包括了:
在AI领域, 存在着这样一些产品, 有AI模型以及工作流微服务产品NVIDIA NIM也就是NVIDIA AI Microservices的;具备有企业级特质的AI软件平台是NVIDIA AI Enterprise 5.0;专门用于机器人开发的仿真环境名为NVIDIA Isaac Sim;推出了GPU加速、性能得以优化的轻量级应用是NVIDIA Isaac Lab;还有为计算编排服务所打造的工具则是NVIDIA OSMO;有用于药物研发的微服务NVIDIA BioNeMo;另外有用于基因组学分析的软件套件NVIDIA Parabricks;以及用于视频分析和智能视频管理属于软件平台的NVIDIA Metropolis等等。
当中, NVIDIA的NIM, 就是NVIDIA AI Microservices, 这点最为显著。
NIM是一系列微服务, 这些微服务集成了AI模型以及工作流, 它专门为企业还有开发者提供一种方式, 这种方式能在生物、化学、影像以及医疗数据领域构建并且部署AI应用, 而且是高效、灵活的方式。NIM的关键优势在于其API符合行业标准, 这便于开发者去创建云原生应用。
当下, NIM 微服务已然着手于医疗影像领域展开推广, 借助 NVIDIA 的 AI 技术, NIM 微服务能够助力医疗专业人员更为迅速、更为精准地剖析与阐释医疗影像数据, 进而提升诊断的质量与效率。另外, NIM 微服务可用于药物研发, 凭借生成式化学模型以及蛋白质结构预测模型, 加快新药的发现与开发进程。
实际上, 软件应用生态, 除了于AI等开发方面对英伟达的GPU业务予以支撑, 在将来, 也存在为英伟达开拓出一条全新增长曲线的可能性。
SaaS行业被公认为是, 毛利更高, 赚钱速度快, 软件、应用研发资产轻薄, 不像硬件生产那样要遭受供应链的限制约束, 并且不存在生产压力, 也没有库存压力。
虽说英伟达这一公司所拥有的GPU, 凭借着AI所带来的有利形势, 也能够收获极为丰厚的利润进而赚得盆满钵满, 然而其增长速度相较于呈现爆发式增长态势的OpenAI而言, 却是有所不及的。并且倘若仅仅从事GPU以及算力方面的生意, 那么在未来的发展进程中所能具备的空间, 也难以避免地会受到制造业自身增长较为缓慢这一属性的作用与影响。
早已垄断了GPU生意的英伟达, 当然不期望如同AMD、Intel、高通那般, 在芯片行业里辛苦打拼、竞争激烈。对英伟达来讲, 凭借AI大模型、软件等朝着更高方向迈进一层, 不但能够稳固自身当下在行业里的地位, 还能够拓展未来的发展轨道。
算力怪兽的关注点在通信
有一款专为AI而生的软件叫Blackwell, 它能够处理那种具有万亿参数规模的大语言模型, 也就是LLM。每块GPU有着数目达到2080亿个的晶体管 , 它依照专门定制的双倍光刻极限尺寸4纳米TSMC工艺制造而成 , 借助10 TB/s的片间互联方式 , 实现把GPU裸片连接成一块统一的GPU。
推出的还有新一代GPU B200, 它采用双芯片设计, 单GPU AI性能达20 PFLOPS, B200还配备192GB内存。另外还有基于B200的超级芯片GB200, 它通过900GB/s超低功耗的片间互联, 把两个NVIDIA B200 Tensor Core GPU和NVIDIA Grace CPU相连, 这是与Blackwell平台一同推出的。
尽管Blackwell在性能改进方面提升幅度极大, 然而现今的超大规模AI模型中大都是要通过多GPU并联来进行计算的。如此一来, GPU的连接性能才在AI大模型训练以及应用进程里充分展现出了其价值。
第五代英伟达NVLink, 能给予1.8TB每秒双向吞量, 可让576块GPU之间达成无缝高速函讯, 去契合更繁杂的大语言模型训练所需。
英伟达在云端模型部署方面, 还推出了NVIDIA Quantum-X800 InfiniBand,以及Spectrum-X800以太网网络平台, 该平台有的是那样一种能提供高达800Gb/s端到端吞吐量的能力, 这一能力大幅提高了AI和HPC分布式计算的可用性。
另外, 英伟达推出了6G研究云平台, 用来推动AI在无线接入网络 (RAN) 技术中的应用。其保证了端侧设备同云基础设施之间的链接, 进而对自动驾驶汽车, 智能空间以及沉浸式教育体验的发展起到推动作用。

英伟达全新网络交换机 - X800 系列。
伴随着Blackwell架构被一同宣布的, 是英伟达跟主流服务器、以及云计算厂商开展的合作行动。在未来, AWS、戴尔、谷歌、Meta、微软、OpenAI、甲骨文、特斯拉和XAI等, 预计都会针对加速计算服务器, 进行更新, 使其适配Blackwell架构。
促进落地是英伟达的当务之急
就GPU硬件来说, 英伟达于全球GPU市场里始终维持着领先地位。Blackwell的性能相较于2年前的Hopper架构提高了5倍, 相较于8年前的Pascal架构提高了1000倍。
黄仁勋于演讲之际, 颇为自豪地讲道, 摩尔定律乃是每10年便提升100倍性能, 在过往的8年时间当中, 我们实现了提升1000倍, 并且我们还少使用了2年时间。

英伟达GPU性能八年提升1000倍
布莱克韦尔一经出现, 行业领域顿时呈现出一片欢腾的景象, 众多的人都大声呼喊着: 新的摩尔定律已然诞生了!
相对于英伟达的用户,华尔街对英伟达的看法相对冷静。
就在刚刚过去的那个3月的前几周时间里, 英伟达遭遇了市场的逼空情况, 在3月8日这一天, 其股价出现了下跌, 跌幅为5.55%。尽管华尔街方面对于英伟达在本届GTC上的表现持有乐观态度, 并且市场上普遍都做出了这样的预测, 即此次大会能够助力英伟达股票终结近期所呈现出的震荡走势。然而, 在黄仁勋进行完主题演讲之后, 英伟达的夜盘表现并不理想, 到了次日开盘的时候, 其股价同样没有出现好转的迹象。
这主要是由于, GTC上公布了重磅新品, 而这对于市场而言, 基本上都处于预期范围之内。实际上, 对于英伟达来讲, 不管是8年前的Pascal, 还是如今的Blackwell。GPU架构每隔1 - 2年进行一次升级, 早就是合乎逻辑的技术迭代了。到了2024年, 推出Blackwell, 在英伟达这里是“渐进式创新”的必然产物。
再者, 就当下的市场情形而言, 伴随GPU技术的不断更新换代, 算力的迅速提升极有可能会极大地挤压英伟达原本的增长余地。
在3月7日, 方舟投资首席执行官、那个被称作“木头姐”的知名投资人凯西·伍德(Cathie Wood), 在一封写给股东的信里, 针对英伟达未来或许会碰到的竞争压力发出了警告, 并且把它跟思科在1997至2000年期间股价所呈现的“抛物线”情况做了比较。
伍德持有这样一种观点: 要是AI公司以及软件公司, 在实现效果的应用层面, 始终都没办法看到收益状况的话, 大概率就会停止加大在GPU建设这一方面的投入力度。
单一只是按部就班地去提升GPU性能, 明显是没办法确保英伟达业务能够长期实现增长的。针对于这点, 英伟达有必要给客户供给更多围绕着GPU来构建业务能力的工具。大概英伟达其实早就已经认识到了这一情况。
针对于传统的GPU图形渲染这块, 英伟达着重向着客户去推广工业数字孪生应用以及工作流创建平台Omniverse。这次的GTC, 还宣告了最新的NVIDIA Omniverse Cloud API, 借助它来协助开发者把Omniverse技术融入到他们的设计与仿真工具当中。
英伟达又公布了跟西门子、达索系统、Ansys、楷登软件、新思科技等主要工业软件厂商的更深入合作。
在AI领域, 于本次GTC期间, 英伟达公布了一款人形机器人基础模型, 名为NVIDIA Project GR00T。它能够支持借助语言、视频以及人类演示来开展学习动作与技能的活动, 这为机器人技术的AI应用创造了新的可能性。Project GR00T与前段时间Figure所推出的, 运用OpenAI大脑进行控制的机器人, 存在着某些近似之处。Project GR00T当属一个多模态的人形机器人通用基础模型, 它能够让机器人借由观察人类行为去模仿动作, 进而得以快速学习协调、灵活性等技能。
除此以外, 英伟达始终致力于打造的机器人开发与仿真环境Isaac平台, 此次也进行了升级, 加入了生成式AI基础模型, 还有仿真工具, 以及针对机器人学习和操作的优化工具。
正在改变与想要改变世界的人,都在 虎嗅APP



