⁕ ⁕ ⁕
Третья часть этого поста — про будущее.
Вчера OpenAI представила первый кастомный чип, который, якобы, на 50% оптимальнее для инференса, чем чипы от NVIDIA. Печатает их TSMC, проектирует Broadcom, стандартный комплект.
Энтузиаст недавно прошил microGPT прямо на FPGA. Это такие процессоры, логику работы которых можно поменять за несколько секунд-минут (перепрошить). У них относительная низкая тактовая частота (сотни и даже десятки мегагерц против гигарец современнных процессоров), зато если получится уложить весь алгоритм в «железную логику», то чип начинает выдавать готовый ответ на каждый такт, то есть миллионы раз в секунду. FPGA используют для обработки видео, сигналов, на ракетах и в радарах — в приложениях, где важна скорость и надежность. Есть много экспериментов, когда в них укладывали небольшие модели.
Компания TAALAS пошла дальше всех и разработала чип, который реализует Llama 3.1 8B прямо в кремние. Это приличная open source модель 2 летней давности, пусть и с небольшим контекстом (6 тысяч токенов против привычных сотен тысяч сегодня). Самая крутая ИИ-карта Nvidia B200 дает 353 токена в секунду на пользователя в этой модели, а аппаратная реализация TAALAS — 16 тысяч токенов в секунду. Попробовать самому можно на сайте chat jimmy. А теперь представьте, что это нормальная взрослая модель и используется для разработки софта. Дух захватывает.
P. S. Параллельно развиваются специализированные локальные модели, которые работают на компьютерах и телефонах пользователей (тут впереди всех Apple) и есть отдельное движение за децентрализованный инференс (как у криптовалют), у его апологетов я недавно брал интервью, но это уже совсем отдельная история.
Post #2087
15.4K
