TGViewer
Плюшевый Питон Плюшевый Питон @plush_python · 681 subscribers
Post #85 1.85K
Сегодня делюсь с вами крутым списком ключевых статей по NLP, опубликованных _после_ BERT, по мнению Ильи Гусева. Кто не знает, это один из авторитетнейших экспертов в NLP. Илья составил этот список в ответ на вопрос пользователя в одном из профильных чатов. Не знаю, будет ли где-то ещё публиковать, но я уверен, что этот список точно заслуживает внимания, поэтому решил репостнуть здесь.

- GPT-2, Radford et al., Language Models are Unsupervised Multitask Learners, https://d4mucfpksywv.cloudfront.net/better-language-models/language_models_are_unsupervised_multitask_learners.pdf
- GPT-3, Brown et al, Language Models are Few-Shot Learners, https://arxiv.org/abs/2005.14165
- LaBSE, Feng et al., Language-agnostic BERT Sentence Embedding, https://arxiv.org/abs/2007.01852
- CLIP, Radford et al., Learning Transferable Visual Models From Natural Language Supervision, https://arxiv.org/abs/2103.00020
- RoPE, Su et al., RoFormer: Enhanced Transformer with Rotary Position Embedding, https://arxiv.org/abs/2104.09864
- LoRA, Hu et al., LoRA: Low-Rank Adaptation of Large Language Models, https://arxiv.org/abs/2106.09685
- InstructGPT, Ouyang et al., Training language models to follow instructions with human feedback, https://arxiv.org/abs/2203.02155
- Scaling laws, Hoffmann et al., Training Compute-Optimal Large Language Models, https://arxiv.org/abs/2203.15556
- FlashAttention, Dao et al., FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness, https://arxiv.org/abs/2205.14135
- NLLB, NLLB team, No Language Left Behind: Scaling Human-Centered Machine Translation, https://arxiv.org/abs/2207.04672
- Q8, Dettmers et al., LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale, https://arxiv.org/abs/2208.07339
- Self-instruct, Wang et al., Self-Instruct: Aligning Language Models with Self-Generated Instructions, https://arxiv.org/abs/2212.10560
- Alpaca, Taori et al., Alpaca: A Strong, Replicable Instruction-Following Model,
- LLaMA, Touvron, et al., LLaMA: Open and Efficient Foundation Language Models, https://arxiv.org/abs/2302.13971

P.S. Коллеги из того чата также предложили добавить в список статью про Flan-T5, я согласен с этим: https://arxiv.org/abs/2210.11416
arXiv.org Language Models are Few-Shot Learners Recent work has demonstrated substantial gains on many NLP tasks and benchmarks by pre-training on a large corpus of text followed by fine-tuning on a specific task. While typically task-agnostic...
More from @plush_python
  1. Sep 23, 2026Успел немного потестировать Opus 5.5 в Claude Code, хочу поделиться впечатлениями. Если чт…
  2. Sep 9, 2026Ща буит суперспорный тейк, провоцирующий на холивар, но не зря же я комменты отключал - мо…
  3. Sep 3, 2026Поднимаю (с помощью Kimi K3) с колен свой долгострой многолетний пет-проект, о котором пис…
  4. Aug 28, 2026Автоматизации рутины Поделюсь некоторыми автоматизациями, которые настроил для себя в ИИ-а…
  5. Aug 25, 2026Личная подписка на Kimi Активно использую Codex, но на днях решил поэкспериментировать с к…
  6. Jun 9, 2026ИИ надо использовать так, чтобы было не заметно, что вы использовали ИИ
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →