Отчёт: Nvidia и её крупные клиенты наконец решили проблему развертывания чипов Blackwell
Год назад генеральный директор Nvidia Дженсен Хуан сообщил аналитикам, что из-за резкого усложнения нового поколения искусственного интеллекта Blackwell, процесс перехода их клиентов с предыдущих серверных чипов AI на этот чип будет «сложным». Он отметил, что для повышения производительности чипа «необходимо внести изменения на всех этапах — от серверного корпуса и архитектуры системы до аппаратной конфигурации и системы электропитания».
На самом деле, для основных клиентов Nvidia внедрение серверов Blackwell и их масштабная эксплуатация стали серьезной проблемой. Как сообщили два сотрудника Nvidia, обслуживающие OpenAI и других крупных клиентов, а также один сотрудник Meta, непосредственно столкнувшийся с решением этих вопросов, большую часть прошлого года OpenAI, Meta Platforms и их партнеры по облачным сервисам сталкивались с трудностями при стабильном развертывании и использовании подобных систем. Все собеседники отмечают, что после получения предыдущих AI-чипов Nvidia клиенты могли внедрять и запускать их в течение нескольких недель, чего не удавалось с Blackwell.
Однако многочисленные трудности, с которыми столкнулись основные клиенты Nvidia при использовании чипов серии Blackwell (особенно модели Grace Blackwell), похоже, не нанесли серьезного ущерба бизнесу этого гиганта индустрии. Nvidia по-прежнему является самой дорогой компанией мира с рыночной капитализацией в 4,24 триллиона долларов, и в настоящее время она в значительной степени решила многие технические проблемы, препятствующие быстрой и масштабной интеграции этих чипов у крупных клиентов.
Тем не менее, если будущие новые чипы Nvidia столкнутся с аналогичными проблемами развертывания, такие конкуренты, как Google, могут получить шанс на прорыв — при условии, что смогут помочь клиентам быстрее внедрять чипы для поддержки передовых AI-технологий. Подобные проблемы также могут привести к снижению прибыли облачных сервисов, не сумевших масштабировать внедрение чипов, а также замедлить темпы исследований компаний AI, разрабатывающих новые модели на их базе.
Данный материал основан на интервью с сотрудниками Nvidia, Meta, работниками облачных сервисов, использующих чипы Nvidia, и партнерами, предоставляющими услуги по установке чипов Nvidia в дата-центрах.
Для таких клиентов, как OpenAI и Meta, невозможность развернуть кластеры чипов в нужном масштабе ограничивает их способность обучать более сложные AI-модели. Как рассказал один из сотрудников Nvidia, хотя клиенты публично не жаловались на эти проблемы, некоторые выразили свое недовольство представителям компании в частном порядке.
Чтобы компенсировать убытки пострадавших клиентов, как сообщили топ-менеджер облачной компании и сотрудник Nvidia, участвовавший в переговорах, в прошлом году Nvidia предоставила частичные компенсации и скидки на чипы Grace Blackwell.
Как сообщили представители Nvidia и облачных сервисов, основная проблема заключалась в серверах, где было скомбинировано 72 чипа Grace Blackwell — подобная архитектура должна была значительно повысить скорость обмена данными между чипами и обеспечить их совместную работу в рамках одной системы. Такие серверы могут объединяться в сверхкрупные кластеры, чтобы предоставлять вычислительную мощность для интенсивного обучения AI-моделей.
По словам представителя Nvidia, компания в 2024 году уже ответила на вопросы по поводу медленного развертывания системы Grace Blackwell и заявила в интервью журналу «The Information», что такие системы являются «самыми передовыми компьютерами в истории», и их внедрение требует «совместной инженерной разработки с клиентами».
В заявлении также отмечается: «Nvidia ведет тесное сотрудничество с ведущими облачными сервисами, их команды стали неотъемлемой частью нашей инженерной системы и процессов, подобные итерации являются нормальным явлением для отрасли и предусмотрены нашими планами».
Глава инфраструктурного направления OpenAI Сачин Кати отметил, что сотрудничество стартапа с Nvidia «полностью соответствует нашему плану по предоставлению вычислительных ресурсов для дорожной карты исследований. Мы используем все доступные чипы Nvidia для обучения моделей и обработки запросов, что обеспечивает быстрые итерации и внедрение продуктов; недавние релизы множества моделей — лучшее тому подтверждение».
Представитель Meta отказался комментировать ситуацию.
Болезни роста
Есть признаки того, что Nvidia извлекла уроки из этих проблем развертывания. Компания не только оптимизировала существующие системы Grace Blackwell, но и начала работу над усовершенствованием серверов на базе нового поколения чипов Vera Rubin, которые выйдут позже в этом году.
По словам двух специалистов, участвовавших в проектировании чипов, в прошлом году Nvidia выпустила усовершенствованный Grace Blackwell с повышенной производительностью, чтобы обеспечить его большую стабильность по сравнению с первым поколением. Они заявили, что обновленный чип, названный GB300, отличается улучшенным охлаждением, качеством материалов и коннекторов.
Один из сотрудников Meta сообщил, что инженеры компании, испытавшие технические сбои с первым поколением Grace Blackwell, отметили значительное снижение сложности объединения новых чипов. Другой сотрудник Nvidia, обслуживающий OpenAI, поделился, что OpenAI и некоторые другие клиенты уже скорректировали заказы на Grace Blackwell, выбрав усовершенствованную версию, которая еще не поступила.
Осенью прошлого года Nvidia сообщила инвесторам, что большую часть выручки от серии Blackwell приносят усовершенствованные серверы Grace Blackwell, а массовые поставки этих серверов запланированы на этот год.
xAI — компания Илона Маска, сильно зависящая от чипов Nvidia, похоже, лидирует в отрасли по внедрению серверов Grace Blackwell. В октябре прошлого года компания развернула около 100 тысяч чипов в дата-центре в Мемфисе, однако пока неясно, привела ли такая стратегия к лучшим результатам.
Сначала построить, потом тестировать
Целью разработки Blackwell в Nvidia было помочь клиентам обучать AI-модели в масштабах и с эффективностью, значительно превосходящими предыдущие поколения чипов.
В предыдущих серверах Nvidia можно было объединять максимум 8 чипов, а скорость связи между ними была низкой. Концепция Blackwell — это соединение 72 чипов Grace Blackwell в одном сервере, что позволяет снизить объем передачи данных между серверами, разгрузить сеть дата-центра и поддерживать обучение и эксплуатацию более масштабных моделей AI.
По словам сотрудника Oracle, участвовавшего в построении кластеров чипов, такая архитектура позволяет не только создавать более крупные кластеры, но и повышает качество моделей, обучаемых на них; система изначально задумывалась для минимизации типичных аппаратных сбоев в процессе обучения.
Однако новая конструкция от Nvidia оказалась уязвимой. Высокая интеграция большого количества чипов означает, что сбой одного из них может вызвать цепную реакцию, ведущую к сбою или остановке всего кластера из тысяч чипов. По словам трех людей, столкнувшихся с подобными сбоями, перезапуск процесса обучения с последней сохраненной точки может стоить от нескольких тысяч до миллионов долларов.
Внедрение системы Nvidia Grace Blackwell с самого начала сопровождалось трудностями. Летом 2024 года из-за дефектов проектирования массовый выпуск был отложен, и проблемы начали проявляться. После первых поставок Blackwell год назад клиенты столкнулись с перегревом и сбоями соединения в серверных стойках, что привело к тому, что Microsoft, Amazon Web Services, Google, Meta и другие ключевые покупатели сократили заказы и вернулись к предыдущим поколениям чипов.
Сотрудники нескольких облачных сервисов, заказавших Grace Blackwell, считают, что Nvidia поставляла чипы клиентам до завершения полной отладки софта и железа.
Однако бывший топ-менеджер Nvidia оправдывает такую стратегию компании, считая, что «болезни роста» серверов Grace Blackwell с 72 чипами — это результат стремления Дженсена Хуана к прорыву, а не к осторожному развитию. По мнению нынешних и бывших сотрудников, ожидать, что Nvidia сможет точно предсказать производительность чипов в масштабных сценариях OpenAI, Meta и других клиентов, не вполне реалистично.
Есть также признаки того, что OpenAI уже внедрила масштабное использование серверов Nvidia с 72 чипами. В четверг OpenAI объявила, что новейшая модель для генерации кода GPT-5.3-Codex была разработана, «получая вычислительные ресурсы и поддержку развертывания от специально спроектированной системы».
Трудности с монетизацией
Как рассказали два топ-менеджера облачных сервисов, в прошлом году задержки с развертыванием чипов привели к убыткам для части партнеров OpenAI по облачным услугам — эти компании инвестировали значительные средства в Grace Blackwell, рассчитывая на быструю эксплуатацию и возврат инвестиций, однако они могут получать доход только после запуска чипов клиентами.
По словам одного из топ-менеджеров облачного сервиса, участвовавшего в переговорах, чтобы снизить финансовое давление, часть компаний договорилась с Nvidia о скидках, оплатив только небольшую часть стоимости чипов, исходя из фактического объема использования.
Еще один сотрудник Nvidia и представитель производственного партнера Nvidia отметили, что компания также вернула деньги некоторым клиентам, вернувшим серверы.
Когда облачные сервисы внедряют новые технологии, они сначала несут издержки, а доход начинают получать только после запуска оборудования клиентами, поэтому на этом этапе маржа обычно низкая. Согласно документу, за три месяца, закончившихся в августе прошлого года, Oracle потеряла почти 100 млн долларов на аренде чипов Blackwell, поскольку срок между завершением настройки серверов и началом их использования (и оплатой) клиентами, такими как OpenAI, оказался слишком большим.
Внутренняя презентация для руководства облачного бизнеса Oracle показывает, что валовая маржа аренды Grace Blackwell была отрицательной, в основном из-за проблем с внедрением чипов в дата-центре OpenAI в Абилине, штат Техас, и задержек с приемкой оборудования клиентами.
Позднее Oracle заверила инвесторов, что ее облачный бизнес AI в итоге выйдет на валовую маржу 30–40%, и этот прогноз учитывает период предварительных инвестиций до запуска дата-центра.
Представитель Oracle отказался комментировать ситуацию.
Ответственный редактор: Дин Вэну
Дисклеймер: содержание этой статьи отражает исключительно мнение автора и не представляет платформу в каком-либо качестве. Данная статья не должна являться ориентиром при принятии инвестиционных решений.
Вам также может понравиться
Парамонт завершила крупное слияние с Warner Bros, создав гигантскую голливудскую компанию Skydance.
Общий долг объединённой компании составляет около 80 миллиардов долларов. Дэвид Эллисон и совместный генеральный директор Инон Крейц сталкиваются с целью сократить расходы на 6 миллиардов долларов. Руководство телеканалов CNN и CBS News останется без изменений. 6 октября, Reuters – Paramount-Skydance (PSKY.O) во вторник завершила крупное приобретение компании Warner Bros. Discovery (WBD.O) на сумму 110 миллиардов долларов, в результате чего появилась голливудская компания-гигант под названием Skydance, а генеральный директор Дэвид Эллисон взял под контроль одну из крупнейших развлекательных компаний мира. Эта сделка объединяет студии, стоящие за фильмами Mission: Impossible, Harry Potter и DC, с такими крупными телевизионными и стриминговыми сетями, как CBS, CNN, Paramount+ и HBO Max, образуя крупную развлекательную компанию, охватывающую кино, ТВ и новости. Во вторник акции объединённой компании были переведены с Nasdaq на Нью-Йоркскую фондовую биржу, их тикер – SKYD. Совместное соглашение с альянсом американских штатов и Гильдией сценаристов Голливуда устранило основные юридические препятствия в одной из крупнейших сделок в истории медиа-индустрии. Это произошло на фоне снижения количества подписок на кабельное ТВ, дорогостоящей борьбы за зрителей потоковых сервисов и давления со стороны профсоюзов по вопросам занятости и прав творческих работников. На прошлой неделе Эллисон сообщил, что выбор названия "Skydance" был направлен на сохранение независимости студий Paramount и Warner Bros., вместо объединения их под новым брендом. Однако аналитики отмечают, что название усиливает контроль Эллисона, подчёркивая, что он теперь управляет одними из самых знаковых брендов Голливуда, а также получил платформу для реализации собственных стратегий и культуры. За короткие 16 лет Skydance превратилась из независимой студии в ключевого игрока голливудской индустрии. Компания была основана Дэвидом Эллисоном, сыном соучредителя Oracle Ларри Эллисона, в 2010 году и стала известной благодаря инвестициям и производству блокбастера Paramount "Top Gun: Maverick". После объединения с Paramount в прошлом году Skydance обратила внимание на Warner Bros., участвовав в напряжённой борьбе с Netflix NFLX.O за приобретение, а также привлекла других потенциальных покупателей, среди которых Comcast CMCSA.O. Широкая голливудская экспансия Эллисон назначил бывшего генерального директора Mattel Инона Крейца на должность совместного CEO Skydance, который отвечает за операционную деятельность и интеграцию, а Эллисон курирует креативное направление и общую стратегию. Задача обоих – интегрировать две крупные компании и достичь заявленной экономии в 6 миллиардов долларов. Paramount уточнила, что значительная часть этих сокращений коснётся “нечеловеческих расходов”, то есть объединения стриминг-технологий и облачных сервисов обеих компаний. Однако столь масштабные сокращения, вероятно, затронут многие рабочие места в различных сферах Голливуда. Ожидается, что объединённая компания также будет иметь долг около 80 миллиардов долларов, и Эллисон будет вынужден развивать стриминг, поддерживать денежные потоки кабельных сетей и повышать доходы от фильмов в кинотеатрах. Президент CNN Марк Томпсон и главный редактор CBS News Бари Вейс продолжат занимать свои руководящие должности в Skydance.
Американский фондовый рынок: фьючерсы на три основных индекса растут, цена нефти Brent опустилась ниже 100 долларов, доходность американских облигаций снизилась
Все три основных фьючерсных индекса США растут.
После новости о расширении производства HDD компанией Toshiba, Morgan Stanley настроен более оптимистично, а не пессимистично
Исследование Morgan Stanley показывает, что масштаб расширения производства Toshiba был значительно переоценен рынком — удвоение производственных мощностей на заводе в Филиппинах за два года соответствует годовой темп роста примерно 30%, что сопоставимо с общим ростом предложения в отрасли и значительно ниже темпов роста спроса. Более важно то, что проверки каналов показывают, что Seagate и Western Digital не собираются расширять производство, и на рынке также не наблюдается никаких признаков ослабления ценовой политики.
После двух месяцев падения SOX на 11%, Goldman Sachs внезапно заявляет о покупке: наступила «золотая яма» для полупроводникового сектора?
Goldman Sachs заявил, что после падения индекса Philadelphia Semiconductor на 11% за два месяца его прогноз на третий квартал стал более оптимистичным: положительно оценивает производственное оборудование, хранение данных и аналоговые решения. Присвоил рейтинг "покупать" таким компаниям, как AMD и еще 11 компаниям, негативно оценивает Arm и Texas Instruments.

