TGViewer
Channel Public Channel
AI4Dev — AI for Development

AI4Dev — AI for Development

@llm4dev

Что надо знать, чтобы остаться востребованным ИТ специалистом в мире с LLM?

• Обзоры продуктов, фреймворков и способы взаимодействия с LLM для разработки софта

• Реальные кейсы, pet и бизнес проекты с LLM

• Публичные лекции

В будущее берут не всех!
Subscribers
5.3K
Photos
177
Videos
53
Links
334

Showing posts older than #553 · Back to latest

Older Posts 19 shown
Post #552 1.74K
RSI: математика сингулярности

Разбираем одну из самых дискуссионных тем в IT-сообществе — рекурсивное самосовершенствование искусственного интеллекта (RSI). Сможет ли ИИ бесконечно улучшать собственный код и архитектуру? Или алгоритмы ждет неминуемый «коллапс» при обучении на собственных синтетических данных? Рассказывает доктор технических наук Владимир Крылов. 

🎥 Запись доступна здесь и на других площадках:

YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
  • 🔥 6
  • 👍 3
  • 🙏 1
  • 🤡 1
Post #551 2.51K
Anthropic добавила в Claude Code Desktop панель iOS Simulator. Запускается стандартный симулятор Apple из Xcode, а Claude управляет им напрямую: собирает приложение, тапает по экранам, читает результат и по кругу, пока не решит задачу. Можно тапать и самому параллельно, устройство общее.

Работает без computer use, разрешения macOS на Accessibility и Screen Recording не нужны. У каждой параллельной сессии свои симуляторы, внутри сессии до 4 устройств, можно проверить сразу на iPhone и iPad.

Только локальные сессии и только macOS (т.к. симулятор Apple больше нигде не работает). Нужен Xcode с iOS-платформой, планы Pro или Max. Пока бета. Не забываем, что скриншоты устройства уходят в Anthropic, в реальные аккаунты на нём лучше не логиниться.
Claude Code Docs Test iOS apps in the simulator - Claude Code Docs Claude Code Desktop opens your app in the iOS Simulator pane when Claude builds, runs, or checks it, with a separate simulator for each session.
  • 👍 4
  • 🤔 1
  • 💩 1
Post #550 1.92K
Индустрия спорит на языке миллиардов долларов и терафлопсов. Но у развития больших языковых моделей есть пределы, которые не двигаются ни деньгами, ни железом — они заданы геометрией данных, теорией вычислительной сложности и теорией информации.

Наш гость Александр Пономаренко —соавтор алгоритмов NSW и HNSW, на которых работает большинство векторных баз данных, а значит и внешняя память почти любой современной ИИ-системы. Лауреат стипендии им. Ильи Сегаловича и IBM PhD Fellowship Award, научный сотрудник ИПФ РАН и лаборатории ЛАТАС, доцент кафедры прикладной математики и информатики НИУ ВШЭ.

Мы не будем задавать лёгких вопросов. Вместо этого обсудим споры, которые сейчас идут в исследовательском сообществе — и попросим гостя рассудить.

⏰ Запускаем трансляцию прямо сейчас!

Смотрите на YouTube или в ВК — и задавайте вопросы Александру!
  • 🔥 6
  • 👍 4
  • ❤ 2
  • 😁 1
Post #549 1.76K
T-Search — открытый агент для сложного многошагового поиска на базе Qwen3.6-35B-A3B, обученный полностью на синтетике. Один из немногих релизов, заточенных под поиск именно в русскоязычных источниках. Модель не пишет ответ, а отдаёт ранжированный список evidence-чанков, дальнейшую генерацию доверяете любой модели под свой продукт. Выложили всё: веса, харнесс отдельным репозиторием и два бенчмарка, включая TRuST — ручной бенчмарк агентского поиска на русском. Фактически это жёсткая связка модель+харнесс: промпты и пороговые значения — ровно та конфигурация, под которую модель обучалась. При этом сам поиск по документам — эмбеддер и векторную базу — поднимаете сами, в комплекте его нет. Просто заменить свой ретривер на T-Search не получится: придётся встраивать всю конструкцию целиком и проверять, как она ищет по вашей базе документов. Подробности про обучение и ссылки на репозитории — в статье на Хабре.
  • 🔥 5
  • ❤ 2
  • 👍 2
  • 💩 1
Post #548 1.69K
Британский AI Security Institute (государственный институт безопасности ИИ) опубликовал замеры разрыва между открытыми и закрытыми моделями в хакерских навыках. GLM-5.2 показывает уровень Opus 4.6 на отдельных задачах (эксплуатация уязвимостей, реверс, крипто) и Opus 4.5 на автономных многошаговых атаках в симулированных сетях. Итого текущий лаг — 4–7 месяцев. В 2025-м было 6–10. Закрытую модель провайдер может мониторить, банить и отзывать. Открытые веса после релиза доступны всем: safeguards снимаются, копии расходятся.
AI Security Institute How Far Behind the Frontier are Leading Open Weight Models on Cyber? | AISI Work We evaluated the cyber capabilities of leading open and closed weight AI models, and found that recent open models GLM-5.2 and DeepSeek V4-Pro perform similarly to frontier closed models released 4 to 7 months before them – a narrower gap than the 6 to 10…
  • 🤔 3
Post #545 1.78K
Moonshot выпустили Kimi K3, 57 баллов в Artificial Analysis Intelligence Index. Выше только Claude Fable 5 (60) и GPT-5.6 Sol (59). Opus 4.8 с его 56 остался позади.

Что интересно в цифрах:

— На GDPval (реальные рабочие задачи) 1668 Elo, третье место после Fable 5 и Sol
— На AA-Briefcase (длинные многошаговые задачи) вообще второе место, обошёл Sol. По качеству аналитики практически паритет с Fable 5: 1760 против 1764
— Цена $3/$15 за миллион токенов, ~$0.94 за задачу индекса. Это примерно вдвое дешевле Opus 4.8 при сопоставимом уровне

Чтобы глубже понимать контекст: в начале июня моделей с 50+ баллами в Artificial Analysis Intelligence Index было две, у Anthropic и OpenAI. Сейчас таких шесть. Только за последние восемь дней фронтир пополнили Grok 4.5, GPT-5.6, Muse Spark 1.1 и вот теперь Kimi K3. Отрыв лидера сжался с четырёх баллов до одного.

Веса обещают опубликовать 27-го. Но чтобы поднять такое у себя, конечно, нужен кластер. Практический смысл открытых весов есть для независимых провайдеров инференса и возможность файнтюна для тех, у кого есть железо.

А ещё ждём показателей Qwen3.8 от Alibaba, которая появилась в превью вчера, и которую они также заявляют как «second only to Fable 5».

Есть повод пересчитать экономику пайплайнов, которые держатся на дорогих моделях для агентских задач.
  • 👍 7
  • 🔥 3
  • ❤ 1
Post #544
Live stream finished (1 hour)
Post #543
Live stream started
Post #542 2.67K
🤔 Какова вероятность выживания человечества в эпоху суперинтеллекта?

Исследователь Элиезер Юдковский и президент MIRI Нейт Соарес изложили свой прогноз в книге, которая только что вышла на русском языке под названием «Если кто-то его создаст — все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех».

Доктор технических наук Владимир Крылов рассмотрит этот прогноз и обоснует возможность значительно более оптимистичного варианта развития событий. Он основан на разработках методов коммуникации с неживым, которые развивает биолог Майкл Левин. Ведь в будущем построение конвенциональных отношений со сверхинтеллектом существенно сократит вероятность рокового исхода...

⏰ Запускаем трансляцию завтра, 16 июля, в 13:00.

Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы лектору!
  • 👍 7
  • 🔥 6
  • 🤡 2
Post #541 1.95K
OpenWiki (LangChain, 1 июля) - открытый агент и CLI, который генерирует и поддерживает «вики» кодовой базы для агентов. Он индексирует репозиторий, фиксирует, где что лежит и как связано, а в CLAUDE.md/AGENTS.md кладёт не сотни страниц, а ссылку: агент сам подтянет нужное. Обновляется по коммитам через CI (GitHub Actions / GitLab / Bitbucket), читает diff с прошлого прогона и правит только затронутое. Провайдеры LLM: OpenRouter (дефолт), OpenAI, Anthropic, Fireworks, Baseten. Поверх DeepAgents, для трейса активностей агентов можно подключить LangSmith. Есть режим personal, локальная база знаний из ваших репо, Gmail, Notion, веб-поиска, и зачем-то даже есть коннекторы к Hacker News и X.
Вдохновлено DeepWiki, AutoWiki и концепцией LLM Wiki Карпаты.

Польза в том, что агент не должен заново разбираться во всём репозитории каждую сессию. Предполагается, что особенно эффективно, если репозиторий большой и legacy.

Открытый вопрос: что происходит с этой памятью со временем. Диффы копятся, глазами такие доки никто не читает. Нужен ли ревью владельцами модулей или дрейф не накапливается и обновления по коммитам достаточно? Если у кого-то уже крутится в CI, или был аналог - расскажите, что видите.
Langchain OpenWiki: Open Source Repo Documentation for Coding Agents OpenWiki generates and maintains codebase documentation so coding agents can find the repo context they need without loading everything into one instruction file.
  • ❤ 4
  • 🤔 3
  • 👍 1
Post #540 2.04K
💥 Агентская фабрика на CI: автоматизируем весь цикл разработки

Лёша Берёзка, техлид iOS в "Додо Пицце" и автор канала о разработке, покажет онлайн, как построить «фабрику» агентов в CI‑пайплайне — систему, которая самостоятельно закрывает полный цикл от создания issue до влития Pull Request.

➡️ Разберём, как организовать оркестрацию нескольких агентов и обеспечить их согласованную работу.
➡️ Посмотрим, как фабрика автоматически заводит issue, сама их планирует, уточняет детали, реализует и доводит Pull Request до успешного слияния.
➡️ Разберём типовые проблемы и способы их решения.

Когда?
Завтра, 15 июля, в 13:00.

Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы Лёше!
  • 🔥 8
  • 👍 2
  • ❤ 1
  • 🤡 1
Post #539 1.7K
В десктопном Claude Code появился встроенный браузер (Cmd/Ctrl+Shift+B). Агент открывает документацию, макеты и произвольные сайты, читает страницы, кликает по элементам и работает с локально запущенным приложением, расширение для Chrome больше не нужно. Браузер живёт в отдельном профиле и не видит логины и историю вашего основного, если агенту нужны именно ваши залогиненные сессии, для этого по-прежнему расширение Claude in Chrome.

Это замыкает цикл фронтенд-разработки: агент пишет компонент, сам поднимает dev-сервер, визуально проверяет интерфейс, воспроизводит пользовательский сценарий и чинит найденное. При первом действии на новом сайте спрашивает разрешение, а в настройках можно выбрать, сохранять ли данные сессий между запусками или каждый раз начинать с чистого листа.
Claude Code Docs Week 28 · July 6–10, 2026 - Claude Code Docs Browse external sites from the Desktop app's built-in browser, run a full setup checkup with /doctor, and pick up auto mode transcript protections and agent view upgrades.
  • ⚡ 3
  • 🔥 2
Post #538 2.08K
Вышло новое поколение моделей OpenAI GPT-5.6: Sol, Terra и Luna. Artificial Analysis (независимая площадка бенчмаркинга LLM ) уже прогнали его по тестам. Главная новость: GPT-5.6 Sol (max) возглавил их новый Coding Agent Index с 80 баллами.

Индекс меряет работу агента целиком (а не только генерацию отдельных функций): исследование репозитория (SWE-Atlas-QnA, вопросы-ответы по большим кодовым базам), доведение задачи до проверяемого результата (DeepSWE, реальные задачи в духе SWE-bench), командную строку (Terminal-Bench v2) и координацию инструментов. Sol в связке с Codex лидирует во всех трёх тестах, при этом стоимость задачи примерно на 40% ниже, чем у Claude Fable 5 (max), и на 10% ниже Opus 4.8 (max) в Claude Code.

Sol — флагман: в Intelligence Index отстаёт от Fable 5 всего на 1 балл (59), но втрое дешевле, $1.04 за задачу. Terra и Luna дешевле на ~50% и ~80%, для массовых задач. По токенам Sol экономнее предшественника: 15k на задачу против 16k у GPT-5.5, при большем интеллекте, чем у Opus 4.8 и Gemini 3.5 Flash.

Похоже, для агентного кодинга Codex + Sol сейчас лучший baseline по цене/качеству. Для аналитически тяжёлых задач Fable 5 всё ещё впереди (Elo 1764 vs 1592 в AA-Briefcase).
artificialanalysis.ai AI Model & API Providers Analysis | Artificial Analysis Comparison and analysis of AI models and API hosting providers. Independent benchmarks across key performance metrics including quality, price, output speed & latency.
  • 👍 6
  • ❤ 1
Post #537 1.96K
🤖 AI-агент с нуля: руководство по MCP

В прошлый раз мы собрали ReAct-агента и разобрали, как работает tool calling под капотом. Теперь идём дальше — подключаем агента к реальному миру через открытый стандарт Anthropic.

Это вторая часть видеокурса об AI-агентах от ML-инженера Artezio Антона Максимова!

Разберём, почему самодельный протокол для инструментов — это тупик при масштабировании и как Model Context Protocol решает эту проблему раз и навсегда. MCP — единый стандарт, который уже поддерживают Claude Desktop, Cursor, Zed и десятки других инструментов.

В этом выпуске:
— Что такое MCP и зачем он нужен, если tool calling уже работает
— Роли в архитектуре MCP и чем они отличаются
— Пишем собственный MCP-сервер на FastMCP
— Подключаем ReAct-агента к серверу

🎬 Смотрите на YouTube или RuTube!

Следующая часть курса будет посвящена Memory, не переключайтесь :)
  • 🔥 8
  • 👍 7
  • ❤ 1
  • 💩 1
Post #536 3.23K
Голосовой агент — это не просто чат-бот + TTS. Это эволюция от текстового бота через полудуплекс к full-duplex, где на каждом уровне появляются свои проблемы. Пройдем этот путь на реальном production-стеке (Rust, ~1600 строк).

Как построить голосового AI-агента, экономящего время пользователя, рассказывает Виктор Загускин — руководитель центра компетенций голосового ИИ в MWS.AI.

В программе:
Голос, файловое распознавание: offline ASR, 3-7с roundtrip, SSML для склонений, LLM-нормализация услуг
Стриминг, полудуплекс: streaming ASR, VAD, гибридное EPD, порог тишины
Полный дуплекс: AEC (WebRTC AEC3), barge-in, tool calls в асинхронном потоке, pipeline parallelism
Метрики: покомпонентная latency, эволюция метрик, бенчмарки (Full-Duplex-Bench v1.5, EVA-Bench)
Native Audio LLM: speech-native модели, DuplexSLA, Moshi, MiniMind-O


🎥 Запись доступна здесь и на других площадках:

YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
  • ❤ 6
  • 🔥 3
Post #535 2.01K
В AI-тусовке на выходных разогнали «новость»: Mistral якобы выпустила модель Le Chaton Fat, которая обходит Claude в benchmark’ах.

Проблема в том, что такой модели нет.

Новость выросла из старого названия ассистента Mistral -  Le Chat. Его уже переименовали в Mistral Vibe, а в X кто-то превратил «кота» в «толстого котёнка» и начал постить фейковые анонсы: MoE на десятки триллионов параметров, миллион токенов контекста, рекордные таблицы и прочий AGI к завтраку.

Дальше скриншоты разошлись, часть людей поверила, CEO Mistral Артур Менш подыграл фразой про le gros chaton, и мем на пару дней стал почти инсайдом. Но самой модели нет.

Разбор Numerama:
https://www.numerama.com/tech/2276253-cest-quoi-le-chaton-fat-le-modele-de-mistral-ai-qui-affole-les-reseaux-sociaux.html

Официальные новости Mistral:
https://mistral.ai/news/
  • 😁 6
  • 👍 1
  • 😭 1
Post #533 2.08K
У Claude будет жёстче проверка аккаунтов

С 8 июля новая privacy policy Anthropic разрешает запрашивать age/identity verification. Для возраста - селфи через Yoti или документ. Для проверки личности - government ID вроде паспорта и live selfie через Persona.

Это не значит, что 8 июля у всех разом попросят паспорт. Но если аккаунт попадёт под проверку, доступ может упереться в верификацию.

Для разработчиков неприятная часть не в самом KYC, а в зависимости от одного consumer-аккаунта. Если Claude уже сидит в вашем рабочем процессе, нужен план Б: резервная модель, сохранённые промпты, экспорт настроек и понимание, чем заменить сервис в день, когда он внезапно попросит документы.Anthropic пишет, что verification data не используется для обучения моделей.

Но вопрос в приватности и доступе к моделям в странах, которые Anthropic официально не поддерживает.

Privacy Policy: https://www.anthropic.com/legal/privacy

Age assurance: https://support.claude.com/en/articles/15171100-age-assurance-on-claude

Identity verification: https://support.claude.com/en/articles/14328960-identity-verification-on-claude
  • 🔥 2
  • 🤬 1
  • 🤡 1
Post #532 1.52K
🚀 Codex CLI: создаём автономный код‑ревьюер

Предлагаем обзор простого, но рабочего сетапа, который позволит:
→ посмотреть возможности Codex CLI;
→ собрать базовую инфраструктуру;
→ реализовать автономный код-ревьюер почти без вмешательства живого специалиста.

"Для работы с агентами нужны 3 главных навыка: адаптивность, слабоумие и отвага. Потому что иногда агент делает очень умные вещи, а иногда — очень странные", — говорит Артем Летюшев, tech project manager twinby.ru и автор канала @junior_pm.

Артем показал в онлайне:
⚡️ как настроить Codex CLI и MCP;
⚡️ как подключить Skills и защитные хуки;
⚡️ как спланировать roadmap и быстро запустить проект.

Запись доступна здесь и на других площадках:

YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
  • ❤ 3
Post #531 1.9K
Разработчик успел до введеных Anthropics ограничений использовать Fable 5  для  реинжиниринга DOS-игры Midwinter (1989). За ночь параллельные агенты разметили 602 функции экзешника, сэкономив полгода ручного реверс-инжиниринга.

Сценарий отлично переносится на анализ закрытых legacy-систем. Секрет в архитектуре: агенты парсили ассемблер через общий evidence ledger, записывая и валидируя гипотезы друг друга. Результат — написанная ими Python-реплика алгоритма, побитово совпадающая с оригиналом.

Чтобы LLM не галлюцинировала в смещениях памяти и регистрах, критически важен именно такой журнал доказательств и локальный sandbox для тестов. Без жесткого фреймворка сверки фактов на выходе получается правдоподобный, но нерабочий код.

Технический разбор процесса:

https://midwinter-remaster.titanium-helix.com/decode

GitHub с ledger-журналом и тулзами:

https://github.com/DrEvil-TitaniumHelix/midwinter-decode

Видео пайплайна:
https://youtu.be/PonvG2whtkc
  • 🔥 17
  • ❤ 2
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →