Как утилита для сжатия файлов случайно стала сердцем GPT
Метод, которым сегодня режут текст на токены все крупные модели (GPT, Claude, Gemini), придумал программист из Колорадо-Спрингс Филип Гейдж. Еще в феврале 1994 года он опубликовал в журнале статью «Новый алгоритм для сжатия данных». Задача была бытовой: как сжать файл на диске. Предложенное им решение состояло в поиске в файле самой частой пары байтов и замене её одним символом. И название он придумал подходящее: Byte Pair Encoding, сокращённо BPE.
Дальше на 21 год об этой разработке все забыли. Казалось, что она была ничем не примечательна: одна из сотен похожих алгоритмов сжатия. Потом идею открывали заново трижды и каждый раз для другой задачи.
В 2012-м инженеры Google Майк Шустер и Кайсуки Накадзима искали способ распознавать голос на японском и корейском, где нет пробелов между словами, и пришли почти к тому же решению под именем WordPiece. В 2015-м команда Эдинбургского университета наткнулась на статью Гейджа, разбирая задачу машинного перевода, и впервые применила BPE не для сжатия, а для сборки словаря частей слов. Точку поставила OpenAI в 2019-м, встроив доработанный BPE в GPT-2 — с этого момента подход стал отраслевым стандартом.
Три команды, три разные задачи — сжатие файлов, голосовой поиск, машинный перевод — и ни одна из них не думала об искусственном интеллекте. Редкий случай, когда узкая инженерная идея переживает свою исходную область целиком: от экономии места на диске до основы, по которой сегодня считается стоимость работы нейросети для пользователя.
Похожих историй в технологиях немало, когда идея ждёт своего контекста годами, иногда десятилетиями, и находит его там, где её совсем не искали.
#LLMпросто
😎 { Синтезиум. Подписка }
Post #111
105




- 👍 2
- 🔥 1