TGViewer
Книжный куб Книжный куб @book_cube · 15.8K subscribers
Post #3823 2.12K
[2/2] История появления Google TPU и их эволюции (Рубрика #Engineering)

Продолжу рассказ про TPU от Google с 2021 года, а точнее с TPU v4.
4. TPU v4 (2021) - Optical Circuit Switching
TPU v4 представил оптическое переключение цепей для ускорения связи между чипами, что критически важно для работы со всё более сложными ИИ-моделями. Производительность составила 275 TFLOPS на чип, с улучшенными оптическими межсоединениями.
5. TPU v5 и v5e (2023) - Оптимизация затрат
TPU v5e и v5p сфокусированы на экономически эффективном обучении на масштабе, с улучшенной энергоэффективностью, динамическим масштабированием и поддержкой разреженности.
6. TPU v6 Trillium (2024) - Оптимизация производительности
Trillium, шестое поколение TPU, предлагает впечатляющий скачок в 4.7 раза по вычислительной производительности на чип по сравнению с TPU v5e. А также обладает следующими характеристиками
- Удвоенная ёмкость и пропускная способность High Bandwidth Memory (HBM)
- Удвоенная пропускная способность межчиповых соединений
- На 67% более энергоэффективен, чем TPU v5e
- Масштабируется до 256 TPU в одном поде с низкой задержкой
7. TPU v7 Ironwood (2025) - опять инференс
Ironwood, представленный в апреле 2025 года, стал заново TPU, специально разработанным для инференса (как TPU v1). Революционные характеристики Ironwood:
- Масштабирование до 9,216 чипов с жидкостным охлаждением
- 42.5 экзафлопс вычислительной мощности (в 24 раза больше самого мощного суперкомпьютера El Capitan)
- 4,614 TFLOPS на чип с 192 ГБ HBM памяти (в 6 раз больше, чем у Trillium)
- 2-кратная энергоэффективность по сравнению с Trillium

Если суммировать то видно, что процессоры Google прошли большой путь. Правда, остается вопроса, а как они чувствуют себя в сравнении с NVidia? И ниже есть ответ на этот вопрос
- NVIDIA H100: 3,958 TFLOPS (FP8), 80 ГБ HBM3, пропускная способность памяти 3.35 ТБ/с
- NVIDIA H200: 3,958 TFLOPS (FP8), 141 ГБ HBM3e, пропускная способность памяти 4.8 ТБ/с
- TPU v6 Trillium: ~2 PFLOPS FP16 для тензорных операций
- TPU v7 Ironwood: 4,614 TFLOPS на чип, 192 ГБ HBM, 7.37 ТБ/с пропускной способности

Как видим по FLOPS все норм. А если смотреть на эффективность по независимым исследованиям, то TPU v5e показывает в 50-70% более низкую стоимость на миллиард токенов для обучения крупных моделей по сравнению с кластерами NVIDIA H100. TPU v5e также потребляет значительно меньше энергии, чем H100 для аналогичной рабочей нагрузки (H100 может потреблять в ~5 раз больше энергии, чем чип TPU v5e под нагрузкой). В реальных задачах показатели примерно такие
- Для обучения GPT-масштабных моделей: TPU более экономически эффективны в 4-10 раз по сравнению с GPU
- Для инференса: TPU v5e обеспечивает в 3 раза больше пропускной способности на доллар
- TPU v4 показал производительность 1.2-1.7 раза быстрее и использует 1.3-1.9 раза меньше энергии, чем NVIDIA A100

В итоге, у TPU есть как преимущества, так и недостатки
(+) Специализация для тензорных операций и глубокого обучения
(+) Высокая энергоэффективность и экономическая эффективность
(+) Интеграция с Google Cloud и оптимизация для TensorFlow/JAX
(+) Масштабируемость в экосистеме Google Cloud
(-) Доступность только через Google Cloud
(-) Меньшая гибкость по сравнению с GPU для различных типов вычислений
(-) Ограниченная экосистема разработки по сравнению с CUDA
(-) Меньший объём памяти на чип по сравнению с новейшими GPU (до недавнего времени)

Если подводить итоги, то кажется, что у Google все хорошо со своей линейкой процессоров для Gen AI / ML задач и они дальше продолжат отстраивать эту инфру, которая дает им значимое конкурентное преимущество в эпоху лета Gen AI приложений. А вот для остальных эти процессоры означают vendor lock при прямом использовании или ориентир, куда стоит стремиться, если смотреть в будущее.

#AI #ML #Software #Engineering #Architecture #Infrastructure #Data
Telegram Книжный куб [1/2] История появления Google TPU и их эволюции (Рубрика #Engineering) Буквально вчера я рассказывал про доклад "CodeFest Russia: Куда катится железо для нейронок?", а сегодня я решил рассказать про то, как у Google появились свои процессоры для перемножения…
  • ❤ 6
  • 👍 3
  • 🔥 2
More from @book_cube
  1. Sep 25, 2026Фелинне Херманс: доступность программирования и цена понимания (Рубрика #AI4SDLC) Если ИИ…
  2. Sep 24, 2026Завтра у меня интересный день, где будет сразу 3 активности, на которых вы можете поймать…
  3. Sep 24, 2026Разбор whitepaper о vLLM: KV-кеш, PagedAttention и быстрый инференс | Research Insights #3…
  4. Sep 24, 2026Команда с ИИ: что меняется в работе руководителя | Code of Leadership S2E22 с Димой Твердо…
  5. Sep 24, 2026SWE-bench: как выбирать агента, когда рейтинг не различает лидеров (Рубрика #AI4SDLC) У од…
  6. Sep 23, 2026Как руководить тем, в чём пока не разбираешься | Леонид Черный | Code of Leadership S2E23…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →