Да, но приготовьте сотни миллионов долларов)
На обучение моделей нужно время. И оно пропорционально числу параметров (условно - "нейронов") и объему материалов.
Утрированный пример: если обучить 1 нейрон на 1мб текста занимает 1 секунду, то обучение 10 нейронов на этом же материале занимает не 10 секунд, как можно было бы подумать, а 100.
Раньше брали нейросеть на несколько сотен тысяч нейронов, брали гигабайт текста, наливали чашечку кофе, запускали обучение... и ехали домой. Через пару дней (на нормальных серверах) получали результат. И результат был печальный.
Но тратить месяцы или даже годы (а по сути — ооочень много денег) никто как-то не решался. Потому, что результат же был весьма посредственный. И небольшой рост параметров особо не влиял. Было 100 тысяч нейронов, сделали 200, а лучше не стало. Сделали 300 - тоже самое. Ну все и забили.
И тут ребятам из OpenAI пришла в голову
И вот тут выяснилось, что количество реально перешло в качество, а нам с вами в руки попал GPT, затем LLaMa, ну а сейчас появляются и новые модели типа Claude. И их будет больше, со временем. Не потому, что раньше денег не было, а потому, что никто не верил в результат. А теперь верят.
Для понимания масштаба — на обучение LLaMa потратили более 3 311 616 GPU часов. Это примерно 378 лет работы одной мощной видеокарты. Или круглый год работы оооочень мощной криптофермы. А у нее всего лишь 70 миллиардов параметров, в сравнении с 175 миллиардов у GPT3 или 1 триллиону у GPT4.
Стоимость такого обучения исчисляется сотнями миллионов долларов. Сотнями. Миллионов. Долларов.
Перечитайте еще раз, прежде чем решите в следующий раз по быстренькому обучить модель на своих курсах или резюме.
Но не все так плохо, на самом деле. Есть еще и так называемый fine tune, когда уже готовую модель дообучают на своих текстах, и это стоит не таких космических денег. А еще есть нейросети узкого профиля. Но про это в следующий раз.