TPU (тензорный процессор)
TPU (Tensor Processing Unit, тензорный процессор) — специализированный процессор Google для ускорения машинного обучения. Он выполняет матричные операции, на которых строятся обучение и инференс нейросетей, быстрее и с меньшими затратами энергии, чем универсальные процессоры.
Что такое TPU
TPU (Tensor Processing Unit, тензорный процессор) — специализированный ускоритель, разработанный Google для задач машинного обучения. Он оптимизирован прежде всего под массовые матричные операции, лежащие в основе обучения и инференса моделей. Google начала использовать TPU в своих дата-центрах в 2015 году, а через год представила их публично.
TPU относится к классу ASIC — микросхем, созданных под одну задачу. В отличие от CPU и GPU, тензорный процессор не рассчитан на произвольные вычисления: его архитектура оптимизирована под умножение матриц и тензоров. Google начала использовать TPU в своих дата-центрах в 2015 году, а в 2016-м представила их публично. Сегодня на TPU работают поиск, переводчик и модели Gemini, а сторонние компании получают к ним доступ через Google Cloud.
Как работает TPU
Основа TPU — систолический массив: решетка из десятков тысяч вычислительных блоков, которые выполняют умножение с накоплением (MAC). В первом поколении их было 65 536. Данные проходят через решетку по конвейеру от блока к блоку, поэтому чип реже обращается к памяти и тратит меньше энергии на каждую операцию.
По данным
исследования Google 2017 года, первое поколение TPU на задачах инференса в среднем было в 15–30 раз быстрее серверных CPU и GPU того времени (Intel Haswell и NVIDIA K80), а по производительности на ватт превосходило их в 30–80 раз.
TPU не работает сам по себе: им управляет хост-сервер на базе CPU, который загружает данные и отправляет чипу команды.
Поколения TPU
TPU v1 (2015) — только инференс.
TPU v2 и v3 (2017–2018) — появилась поддержка обучения, чипы начали объединять в поды.
TPU v4 и v5 (2021–2023) — масштабирование до тысяч чипов для обучения больших моделей.
Trillium, v6 (2024) и Ironwood, v7 (2025) — Ironwood Google позиционирует как чип для инференса.
TPU 8t и TPU 8i (анонс в апреле 2026) — отдельные чипы для обучения (8t) и инференса (8i).
Чем TPU отличается от GPU
|
TPU |
GPU |
| Назначение |
Только машинное обучение |
ML, рендеринг, научные расчеты, HPC |
| Сильная сторона |
Крупные матричные вычисления, энергоэффективность |
Универсальность, зрелая экосистема |
| Фреймворки |
JAX, TensorFlow; PyTorch через PyTorch/XLA, с 2026 года — нативный бэкенд TorchTPU |
Практически все ML-фреймворки через CUDA |
| Доступ |
В основном Google Cloud |
Облако, аренда выделенных серверов, покупка |
На крупных матричных нагрузках TPU может быть выгоднее по цене и энергопотреблению, но уступает GPU в гибкости. GPU подходит для любых задач, от рендеринга до обучения моделей, и поддерживает все популярные ML-инструменты.
Главное ограничение TPU — доступность. Чипы в основном предоставляются через облако Google Cloud. Поставки в собственные дата-центры клиентов Google начала только в 2026 году и лишь для ограниченного круга крупных компаний.
TPU или GPU: что выбрать
TPU имеет смысл, если команда уже работает в Google Cloud и использует JAX или TensorFlow для обучения крупных моделей. Для российских компаний этот вариант обычно недоступен: в марте 2022 года Google Cloud прекратил прием новых клиентов из России.
Для большинства ML-задач практичнее GPU: он не привязывает к одному облаку, поддерживает любые фреймворки и подходит как для обучения, так и для инференса. Можно арендовать
облачные серверы с GPU с NVIDIA H200, RTX PRO 6000 Blackwell, A100 и A800 или
выделенные серверы с GPU с H200, RTX PRO 6000 Blackwell и L40S, если нужен физический сервер целиком.