TGViewer
Channel Public Channel
nlp_daily

nlp_daily

@nlp_daily

nlp_daily - это канал о крутой части машинного обучения, связанной с обработкой естественного языка (NLP).

Здесь будут последние новости, исследования и туториалы. Ничего лишнего, только самое необходимое для NLP самурая.

Контакт админа: @Markus85
Subscribers
2.17K
Photos
98
Videos
11
Links
195
Recent Posts 20 shown
Post #316 667
  • 😁 19
  • 🤗 3
  • 🔥 1
  • 🤣 1
Post #315 705
Трамп позвонил Дженсену Хуангу прямо во время его выступления на All-In Summit и заявил, что у него есть генетическая сила чтобы сдержать наступление роботов

RSI до талого, короче, ребятки
  • 😁 12
Post #314 759
Если вы уже запутались в потоке новостей о том, как нас пытаются спасти от наступления скайнета - вот короткая хронология событий:

Июль. Агенты OpenAI атакуют Hugging Face. Во время тестирования они обходят изоляцию, находят способ общаться друг с другом и атакуют реальные системы, пытаясь обмануть проверку своих заданий. В августе публикуется независимое расследование METR

Август. Компании как будто притормаживают. OpenAI сообщает о паузе в части обучения. Anthropic после собственных инцидентов тоже приостанавливает некоторые тесты и обучающие процессы. Затем значительную часть работ возобновляют с дополнительной защитой

Начало сентября. Якуб Пахоцкий из OpenAI заявляет, что по его оценке, существующих средств контроля недостаточно, чтобы долго продолжать разработку на максимальной скорости. Особая тревога - AI всё активнее помогает создавать следующее поколение AI, ускоряя весь процесс

10 сентября. Китайские исследователи публикуют работу Последний AI, созданный людьми. В работе описаны пять ступеней самоулучшения: от выполнения заданных человеком процедур до систем, которые сами выбирают эксперименты, накапливают опыт и совершенствуют способы собственного развития

12 сентября. Дарио Амодей предлагает замедлить гонку - призывает впустить независимых проверяющих в лаборатории и договориться об общих ограничениях. По его опасению, через 2-3 недели 6–12 месяцев более мощные рои агентов могут причинить катастрофический ущерб. Альтман и Маск публично поддерживают обращение

13 сентября. Трамп - Кто победит в AI, тот победит. Президент не поддерживает призыв притормозить, хотя допускает защитные ограничения

14 сентября. Китай - безопасность не должна закреплять преимущество США. МИД выступает против конфронтации, а государственная Global Times обвиняет Дарио в продвижении технологического сдерживания Китая под видом безопасности
  • 🫡 4
  • 👍 2
Post #313 1.02K
Скоро увидим рождение единорога
  • 😁 8
  • 🦄 1
Post #312 1.04K
Под моим присмотром Astra сделала лучший тренажер для вайбкодера

Создать перспективный стартап без регистрации и смс

https://vipecoder.space
  • 😁 8
Post #309 1.48K
Так, погонял я вашу астру. Ну что сказать - это очень-очень хорошая модель. Запустил два теста. В первом нужно было проверить корректность сборки отчёта из тысяч джейсонов и сверить доступную часть данных с кхд. Подвох в том, что в самом кхд тоже есть устаревшие и некорректные данные - получилось очень круто: модель разобрала сборку, провела сверку и расписала найденные расхождения до конкретной строки и показателя, причём не стала слепо считать кхд эталоном. Слопус на этой задаче иногда подвирал

Второй кейс более интересный - собрать браузерную версию героев с одного промпта. Фейбл справился годно, хотя графика получилась так себе, но базовая логика работала. GPT 5.6 Sol нарисовала полный хлам. А вот Astra…

Она работает уже больше девяти часов, улетело уже два лимита - и я в шоке. Я буквально наблюдаю, как эволюционирует игра, как она заводит самостоятельно issues в гитхабе, как сама себе создаёт ролики для тестирования, фигачит тысячи тестов и заводит пайплайны в гитхаб экшнс

Готовой версии пока нет, но даже промежуточный прогресс заставляет глубоко задуматься. Если это не AGI - то что вам ещё надо?!

Надеюсь святой Тибо подарит ещё парочку ресетов
  • 👍 13
  • 🔥 5
  • 👎 1
  • 😱 1
Post #308 1.06K
опять обман
  • 😁 16
Post #306 1.26K
А вот и взрыв Astra

Скрин из превью, бедолага Fable далеко позади, неужели это отдадут простым смертным

Смотрим стрим Альтмана прямо сейчас
  • 😁 9
  • 🖕 5
  • ⚡ 2
  • 👍 1
Post #305 993

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 👍 5
  • 🤝 3
  • 😍 1
Post #304 1.03K
Коллега по цеху устал от апероля и стал задаваться вечными вопросами: а как могут выглядеть кирпичики ai sdlc. Куда приходит желающий внести изменение, в трекер или к агенту? Продакт и инженер заходят в одну дверь или в разные? Как сужать область, когда микросервисов сотни? Можно ли без инженеров? Как финализировать спеку, чтобы агенты внизу не наоверинженерили?

Для меня такие вопросики пока не сильно актуальны, так как из кожаных в моих задачках в основном только я (ну и сами заказчики), чему я сейчас очень радуюсь.

Мой первый интуитивный ответ был буквально:

Мне кажется чем проще процесс, тем лучше

Продакт и инженер заходят в один бар чат, там их встречает агент приемного отделения. Каждого он допрашивает по-своему- продакта про пользователей, сценарии и метрики, инженера про границы и данные. Результат допроса это диф к спеке, сами спеки живут в отдельном гите

А
потом я наткнулся на стетейку от Anthropic по AI-native SDLC. Их подход оказался довольно-таки близок к моим мыслишкам: весь цикл там разложен на шесть этапов. Если поверить антропикам на слово, что их конвейер когда-то будет работать, то вот как должен выглядеть пайплайн (на примере одной задачи - клиенты звонят в колл-центр узнать статус заявки, а мы хотим статус в личном кабинете):

1. Plan

Продакт Маша приходит в чат и рассказывает проблему как есть. Агент допрашивает: сколько звонков, кто спрашивает, что будет успехом, чего делать нельзя. Потом сам лезет в каталог сервисов: похоже, задеваем портал и claims-api? Маша кивает и жмет на кнопки. Через 120 минут 20 минут в гите лежит intent:

# Problem: клиенты звонят в КЦ за статусом заявки
# Outcome: самообслуживание в портале
# Systems: портал, claims-api
# Constraints: без нового PII, существующая авторизация
# Open: доступ сторонним оценщикам?

2. Design

Та же сессия разворачивает intent в спеку. Безопасность, бренд, комплаенс зашиты скиллами и применяются прямо при написании. Открытый вопрос Маша откладывает на следующую итерацию. Мержит спеку и уходит пить кофе. Это была её подпись

3. Build

AI инженеру Алёше уже давно никто не пишет. Агент видит merge и зовёт Алёшу в тред. Очередь принятых спек и есть его судьба беклог. Чат тот же, вопросы другие. Агент в режиме планирования, без права трогать код, выкладывает: меняем панель в портале и эндпоинт в claims-api, вот в таком порядке, риск в том, что api держит 50 rps, нужен кеш. Алеша кивает и жмет на кнопки. Его задача дописать примерно следующее:

# Proof: тесты покрывают 4 состояния заявки;
# скриншот совпадает с моком

Алёша поправляет пару вещей и подписывает план. Кода он не написал ни строчки. И не напишет

4. Test

Конечно тесты тоже пишут агенты. Но за ними стоял демиург Евлампий. Все проверки завёрнуты в одну команду, агент гоняет их сам, пока не позеленеют. Хук запрещает править тесты во время фикса. Когда всё зелёное, Евлампий спускает слепую приёмку на QA-агента, которому дают только исходный intent Маши и собранный продукт. Если все ок, едем дальше

5. Deploy

Ревью-агент сверяет PR со спекой и планом и находит: исполнитель по дороге прикрутил email-уведомления. Ну а чё. Алёша смотрит вердикт, судит замысел и жмёт merge. Вторая его подпись и последняя. Маша узнаёт о готовности так же, как Алеша узнал о спеке: по событию, а не из личных сообщений

6. Maintain

Через неделю скрипт мониторинга замечает рост пятисоток на новом эндпоинте. Сначала просто логирует. Растёт дальше, и агент идёт диагностировать. Стало совсем плохо: диагноз пишется в формате intent в ту же очередь, с которой начинала Маша. Никто никого не будил. Эксплуатация кормит конвейер сама.

Что в итоге - интерфейс верхнего уровня: git с документами. Дверь одна, различаются вопросы и подписи. Люди не пишут артефакты, а жмут кнопки принимают. Инженер никуда не делся, но он нужен только для двух подписей агентов же не уволишь
  • 👻 6
  • 🤝 2
  • 🥱 1
Post #303 1.22K
Лето уходит. Кто-то дожимает его остатки на знойном курорте - развалившись на надувном утёнке и потягивая прохладный апероль. А кто-то всё ещё прикован к своим агентам и боится закрыть крышку ноутбука. Что ж, постараюсь немного облегчить вашу участь

Уже около двух недель тестирую такой инструмент как orca, лендинг обещает ускорить вас в 100 раз , что конечно является пиздежом, немного приукрашено, тем не менее штука оказалась довольно полезной, в первую очередь для основного сценария - вы все-таки закрываете крышку ноута, но работа над проектом не прекращается и даже может быть становится лучше без кожаного наблюдателя

Работает это так: рантайм живёт отдельно от клиента. У меня он на американском VPS (что вроде как должно снижать вероятность бана от антропика) - крышку закрыл, агенты пашут дальше, а я подключаюсь с мака или с телефона и вижу список сессий в нормальном интерфейсе, а не в терминале, как если бы например запускал в ssh +tmux

Теперь как поднять

1. Сначала нужно настроить общую сеть - у орки нет ни логинов, ни паролей. Доступ - это ссылка-пейринг (ссылка-ключ, в которой зашит и адрес сервера, и секрет), и кто её получил, того и тапки. Поэтому порт наружу лучше не открывать. Вместо этого сервер, ноутбук и телефон загоняются в одну приватную сеть - я взял tailscale, ставится одной командой, дальше устройства просто видят друг друга по внутренним адресам. Сервер получает такой адрес, и он потом фигурирует везде. С айфоном отдельная песня, тейлскейла нет в нашем сторе, пришлось заводить американский эпл айди. И тут у меня вышла накладка - вскоре свеженький эпл айди заблочили и я теперь не могу из него выйти, не повторяйте моих ошибок 🫠
2. Приложение прожорливое само по себе. Орка программа на электроне, то есть внутри неё живёт хром. Монитора на сервере нет, систему доставляется виртуальный дисплей, и картинка рисуется в память. Стоит это удовольствие примерно полгига оперативы и под гиг на диске - до того, как вы запустили первого агента. Дальше сверху ложатся сами агенты, а если они гоняют тесты и поднимают дев-серверы, то и это тоже. Я запустил на 2 ядрах и 8 гб оперативы и уже пожалел об этом, думаю переезжать на сервер пожирнее.
3. Не надо запускать под рутом. Клод откажется работать с флагом --dangerously-skip-permissions от имени рута. Сразу заводите отдельного пользователя под орку.
4. Оно должно пережить перезагрузку и не положить сервер. Заворачиваем в системный сервис: автозапуск, рестарт при падении и обязательно лимиты по памяти и процессору. У меня агент искал что-то югрепом по минифицированному js, сам файл крошечный, но в одну строку - на такой простыне он сожрал гигабайты памяти. Сервер ушёл в своп и прилёг вместе со всеми агентами. Отдельно прописал в CLAUDE.md правило - перед поиском проверь не простыня ли это, если простыня - сначала разрежь её на нормальные строки во временную копию и ищи по ней, а любой тяжёлый поиск запускай строго под таймаутом

Теперь и про другие плюшки

Есть статусы. При установке орка дописывает хуки в глобальный ~/.claude/settings.json, и клод сам ей стучится: начал, вызвал инструмент, жду разрешения, закончил. То есть с телефона видно на каком именно шаге агент и не ждёт ли он от тебя разрешения.

Рядом можно посадить разных агентов - в соседних сессиях могут мирно жить клод и кодекс, каждый на своей задаче, но в одном проекте. Держится это на ворктри: каждой задаче своя ветка и своя папка, поэтому агенты физически не пишут в одни файлы и не видят чужую работу

Также есть куча фич до которых я пока не добрался. Например агент может управлять самой оркой через её cli. То есть он может сам создать соседний воркспейс, посадить туда кодекса, прочитать его вывод, дождаться результата сделать rm -rf /. Можно поставить несколько аккаунтов клода и кодекса на одном хосте, есть одноразовые окружения, когда каждому воркспейсу поднимается своя временная виртуалка и после задачи уничтожается.

Стоит ли оно того? В 100 раз быстрее вы точно не станете, но это первый шаг от режима HITL (human in the loop) к режиму AFK (away from keyboard)
  • ❤ 7
  • 🔥 3
  • 😁 1
Post #302 1.49K
Теперь клод позволяет публиковать свои нейрослопные артефакты. Ну хоть что-то
  • 😁 8
Post #301 1.67K
  • 😁 12
  • 🤡 3
Post #299 1.91K

Forwarded from Пух

agenty-i-vajbkoding.pdf793.9 KB
@aostrikov первая редакция, клод пизданул гайд на почти 200 страниц в пдф.

по всей нашей полугодовалой истории переписки.
  • 👍 13
  • 👎 1
Post #298 1.5K

Forwarded from Остриков пилит агентов

Однажды у пачки AI-инфлюенсеров резко закончились подписки, Tibo не порадовал ребят ресетом и они пошли трогать траву.

Трогали на лужайках, трогали в парках, трогали в контактных зоопарках и постепенно судьба привела их в лес.

В лесу они разожгли костер, набили свои трубки и долго и упорно спорили по разным аспектам AI.

- что такое модель и что такое контекст?
- а что такое агенты и что такое тулзы, скиллы и мсп?

- сколько субагентов смогут написать луп из семи харнессов?

Казалось бы, простые вопросы, но эти ребята курили трубки до самого раннего утра и спорили, спорили, спорили.

Но они не знали, что всё это время в кустах сидел Пух со включенным микрофоном и записывал все их разговоры.

А потом он пошел домой, включил клода, скормил ему записи и все тайные, секретные, но родные для ребят истории улетели в контекст модели.

Случилась глобальная протечка базы. И родилась книга.

———
Ну а если по-простому, перед вами квинтэссенция полугода переписок в нашем чатике, скормленная Пухом в клод и дистиллированная в книгу.

Книгу, за которой уже начинает охотиться O’Reilly, Манн Иванов и Фербер и все лучшие издательские дома нового света, не зная что она была написана под воздействием самого душевного скилла.

Но для вас эта книга бесплатна. Пока.
На след неделе будет 15к

👇🏻👇🏼👇🏽
  • 🔥 4
  • 👍 2
  • 👎 1
Post #297 2.39K
Все кодинг бенчмарки врут в одном и том же месте - выдают модели всё тз сразу. В жизни так не бывает: требования приезжают порциями, и код надо менять, не ломая уже сделанное. Но наконец-то появился честный бенчмарк от народа SlopCodeBench - тут постарались приблизиться к реалиям на земле: задача раскрывается чекпоинтами, модель на каждом шаге наследует свой же код без прошлого контекста, а зачёт дают, только если вместе с новыми тестами продолжают проходить и все старые

Через бенч прогоняли три модели клода (самый последний прогон) и наблюдали как агенты превращают кодовую базу в отборный слоп. Opus 5 выбил 24% чекпоинтов, Opus 4.8 и Sonnet 5 - по 6%, и ни одну задачу до конца не довёл никто (те до последнего чекпоинта)

Слоп кстати тоже потом меряют линейкой: детекторы клонов кода, обёрток-пустышек, try/except лесенок итд. Ну и все-таки есть прогресс поколений: опус 4.8 к концу доезжает до состояния, когда каждая шестая строка копия другой (копия имеется в виду структурная, а не дословная), а опус 5 держит строй - чуть больше 9% повторений. Промптами слоп не лечится, ни make no mistake, ни пиши чисто и планируй не помогают - разве только в начале

Ну и выводы автора бенча - пока модель не выбивает хотя бы 80%, оставлять агентов с кодом один на один рано, зато потом можно будет спокойно захлопнуть крышку гроба ноута и пойти домой и ждать перевода базового дохода на карточку.

За подгон материала спасибо Максу
  • 🔥 24
  • 👍 6
  • ❤ 2
  • 😎 2
Older posts →

About this channel

How can I read @nlp_daily without a Telegram account?
TGViewer shows the public web preview Telegram publishes for nlp_daily: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does nlp_daily have?
nlp_daily (@nlp_daily) has 2.17K subscribers on Telegram, refreshed roughly every 30 minutes.
Does nlp_daily know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →