Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM
Владимир доделал третью часть цикла — теперь про то, как запилить небольшую decoder-only LLM. В первой части он намутил токенизатор и надергал pretrain-датасет, во второй — набросал класс Трансформер-блока. Теперь дело за малым: собрать модель и прогнать pre-train.
Читать далее: Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM
👉 Data Science | Machinelearning [ru]
Post #5768
1.8K

- ❤ 2