На фоне роста популярности и сценариев применения ИИ‑агентов в Google готовят новые чипы, чтобы поддержать изменения в промежуточном ПО, а также трансформируют сети и системы хранения для ускорения обучения и инференса моделей. По данным Google, дата-центры компании обрабатывают около 3,2 квадриллиона токенов в месяц, что примерно в семь раз больше, чем в мае 2025 года.

Концепция модернизации архитектуры ЦОДов Google охватывает обновление оборудования, ПО и уровней оркестровки для бесперебойной работы ИИ-агентов, которые могут увеличить число транзакций логического вывода в 100 раз по сравнению с неагентными рабочими нагрузками. Переработанный инфраструктурный стек дата‑центров Google обладает достаточной эффективностью для распределения агентов по разным кластерам системы, их длительной непрерывной работы и самостоятельного принятия решений.

Важнейшее условие, позволяющее агентам быстрее действовать, рассуждать и принимать решения — эффективный поток данных без «узких» мест в системе. В Google адаптировали управляемый сервис Google Kubernetes Engine к агентной среде, где ИИ-агентов можно быстро запускать в «песочницах» и контейнерах.

Значительно улучшены также собственные чипы Google для поддержки изменений в промежуточном ПО. Недавно представлены тензорные процессоры TPU-8t для обучения и TPU-8i для логических выводов. TPU-8t втрое опережает по производительности чип Ironwood, а TPU-8i имеет 384 Мбайт памяти SRAM и 288 Гбайт — HBM3e, что на 50% больше, чем в чипах предыдущего поколения.

Новый центральный процессор Axion N4A отличается повышенной энергоэффективностью при выполнении таких агентских задач, как оркестровка и вызов инструментов.

Среда, в которой работают ИИ-агенты, оптимизирована для использования KV-кэшей (key-value cache) как рабочей памяти моделей, где хранится важная контекстная информация, необходимая агентам для принятия решений. Это сокращает число обращений к другим областям памяти и к системам хранения данных.

Прведена модернизация сети и систем хранения для сокращения времени обучения и инференса. Так, технология TPUDirect позволяет без накладных расходов на оркестровку быстро перемещать данные из систем хранения в память тензорных процессоров.

Сетевая технология Virgo способна координировать работу миллиона тензорных процессоров в распределенной сети. Она также может объединять графические и центральные процессоры, к примеру, в системе Nvidia Vera Rubin, где где, по данным Google, с помощью Virgo можно подключить до 960 тыс. графических чипов.

Новый фреймворк Pathways распределяет процесс обучения моделей между миллионами тензорных и графических процессоров, помогает координировать вычисления в больших распределенных сетях и устраняет «узкие» места, обычно связанные с библиотекой JAX.

Google — единственный поставщик, у которого есть собственные дата-центры, ПО, аппаратное обеспечение и ИИ-модели, которые в компании могут регулярно оптимизировать. Однако ИИ‑стек Google не универсален, он может не подходить для всех задач. Эксперты J. Gold Associates считают, что Google вряд ли вытеснит Nvidia, поскольку на динамично растущем рынке хватит места для всех игроков.