В начале 2010-х нейросети уже заметно улучшали распознавание речи и изображений. Но запускать их в масштабе Google на обычных процессорах было слишком дорого.
Джефф Дин сделал простую прикидку: если сотни миллионов людей будут разговаривать с Google хотя бы по три минуты в день, для обработки запросов компании может понадобиться примерно вдвое больше дата-центров.
И это только ради одной функции.
Стало ясно: нейросетям нужен не ещё один универсальный процессор, а специализированное железо.
Большая часть их вычислений сводилась к повторению сравнительно простых операций с матрицами. При этом модели нормально работали с пониженной точностью. Значит, можно было убрать лишнюю универсальность CPU и построить чип специально под машинное обучение.
Так появилась первая TPU - специализированная ASIC-плата для инференса нейросетей.
CPU: выполняет почти любые задачи
TPU: максимально быстро считает операции нейросетей
TPU v1 содержала матричный блок из 65 536 восьмибитных умножителей-накопителей и выдавала до 92 TOPS. По тестам Google, она была в 15–30 раз быстрее современных ей CPU и GPU, а по производительности на ватт превосходила их в 30–80 раз.
Чипы начали устанавливать в дата-центрах Google ещё в 2015 году. Позже они ускоряли Search, Translate, Photos, распознавание речи и даже AlphaGo.
TPU родилась не из желания сделать нейросети немного быстрее.
Google просто поняла, что без нового типа процессоров масштабировать ИИ будет экономически невозможно.
Полное интервью:
https://www.youtube.com/watch?v=ue9MWfvMylE