На данный момент молодому ресерчеру(или deeptech стартапу ахах) важно сфокусироваться на 4 направлениях
1. Engineering - Gpu optimisation/distributed training - методы по типу fast attention которые позволили обучить модели типо gpt-4 с большим context length
2. Lora и другие методы адаптеров и файн тюна, в будущем скорее всего у каждого человека будет персональный АИ который будет tailored к нему, вопрос где держать данные пользователя в весах нейронной сети или же в векторной базе данных, чуть позже попробую написать более подробный пост про это
3. Новые методы обучения LLM, такие как
Efficient (Soft) Q-Learning for Text Generation with Limited Good Data
https://arxiv.org/abs/2106.07704
Один из самых красивых пейперов которые видел за долгое время
4. Meta learning LLM, Джон Шульман фаундер опенаи, один из самых мощных специалистов по meta learning в мире, поэтому это дело времени когда мы увидим meta learning llm
Post #16
6.44K
- 🔥 7
- 🥰 2
- ❤ 1
- 👍 1