Читаете пост/статью, смысл которой вам не до конца ясен, так как предметная область не вполне родная, вы замечаете кучу терминов и отсылок, вы словно «вязните» и раздражаетесь?
Ниже — простой рецепт, как может помочь LLM, и очередные соображения насчет Deepseek v4.1 Flash, арены, метода ELO и сравнения моделей.
Есть мнение, что Deepseek 4.1 Flash слабоватая модель, годная только для исполнения спек и фиксов. Вполне возможно, это так, но мне не нравится такая категоричность так же как использование линейной шкалы ELO в арене, создающей явные когнитивные искажения.
Я решил проверить DeepSeek на специальных задачах, язык не поворачивается назвать их ресерчами, скорее это такой рисерч-ассистент, помощник-онтологизатор.
Короче, задача частая: предположим, вы читаете статью, смысл которой вам не до конца ясен, так как предметная область не вполне родная, вы замечаете кучу терминов и отсылок, вы словно «вязните» в новом смысле, будто внезапно вместо идеального зрения у вас -5. Вы злитесь, вас это раздражает.
Например, для многих сейчас это частый паттерн при чтении статей об AI в целом, или ресерч-статей о методах и архитектурах для специалистов в AI/ML.
Как можно помочь читателю разобраться глубже? структурировать более детальный смысл статьи в «обучающем» ключе.
Например, вместо обычного саммари собрать «обучающее» саммари в три раздела:
- краткое содержание
- краткий глоссарий всех терминов
- другие наиболее важные либо цитируемые статьи с кратким описанием почему они интересны.
Я гонял такие промты на GPT, погонял и на DeepSeek. Мне в целом тексты GPT показались приятнее, но не катастрофически, и если подходить с точки зрения рейтинга, то это никак не 0 и 1, скорее 90% и 80%. И это точно не «разные классы», по крайней мере, на таких задачах.
Является ли такая задача слабой? С одной стороны да, тут мало «синтеза». С другой стороны с точки зрения интеллекта такая структуризация в целом очень частая и важная задача, фактически же это enabler построения любого пайплайна: из общего/краткого описания собери структуру, гейтвеи, это уже ближе к оркестрации чем к фиксам.
Что лишний раз меня убеждает в том что 1) по крайней мере арена - сомнительный источник информации о сравнении качества моделей 2) хороший манифест/процесс и слабая (но быстрая) модель может быть лучше супер-модели но слабого процесса
Post #560
3.64K
- 💯 17
- 👍 7
- 🔥 5
- 🤔 4