TGViewer
Channel Public Channel
𝘋𝘌𝘈𝘓𝘌𝘕𝘟 ⚡️ Одобряет!

𝘋𝘌𝘈𝘓𝘌𝘕𝘟 ⚡️ Одобряет!

@dealenxfeed

Материалы про AI-разработку и автоматизацию

Очень часто я хочу поделиться тем, что мне очень нравится. Активно делюсь постами разных авторов, чьи материалы понравились и были полезны
Subscribers
23
Photos
322
Videos
48
Links
366
Recent Posts 14 shown
Post #538 3

Forwarded from Максим Горшенин | imaxai

Глава Nvidia признался, что не знает свой адрес и номер телефона

Такое признание Дженсен Хуанг сделал в ходе интервью, в котором объявил, что в мире наступает эра низкого IQ

Предприниматель не видит проблемы в том, что дети перестанут знать таблицу умножения и делить столбиком, поскольку это может делать ИИ. По его словам, базовая математика забывается, но потеря интеллектуальной ловкости компенсируется умением мыслить системно

В интервью Хуанг отметил, что дети уже хуже знают таблицу умножения, деление столбиком и извлечение квадратных корней

По его мнению, часть интеллектуальных навыков действительно будет утрачена, однако люди станут лучше мыслить на уровне сложных систем. В качестве примера он привел современных инженеров, которым не требуется знать устройство транзистора в компьютере

Сам Хуанг признался, что тоже испытывает некоторые проблемы с базовыми умениями, например, он не знает свой адрес проживания, а также номер телефона. Топ-менеджер добавил, что может с этим смириться — для него это неважно. В то же время он добавил, что потеря части «тонкой интеллектуальной ловкости» позволит людям «лучше думать системно», а ИИ сделает всё остальное за человека

📸 Justin Sullivan / Getty Images

Telegram | VK | MAX
Post #532 7

Forwarded from AI for Devs

⚡️ Low, medium, high или max: выбираем effort для модели

Инженер Anthropic разобрал на примерах, что меняется при переключении effort в Claude Code. Если вы до сих пор не уверены, какой уровень ставить, вот короткая шпаргалка.

TL;DR: Чем выше effort, тем больше Claude сам принимает решений, проверяет результат и ищет крайние случаи.

• Low — наброски, обсуждение идей и простые правки, когда хочется быстро получить ответ и продолжить диалог
• Medium — обычная разработка, в том числе реализация новых фич
• High — баги в существующем коде и задачи, где важно тщательно проверить результат
• Max — сложная автономная работа от начала до конца, например сборка приложения или поиск уязвимостей в критичном ПО

На расплывчатых задачах высокий effort означает ещё и больше предположений, которые Claude сделает за вас. Поэтому Тарик предлагает сначала уточнить требования, собрать первую версию на low или medium, посмотреть, правильно ли Claude понял задачу, а затем переключиться на high для тестов и проверки.


На самом деле выбор effort руками сейчас выглядят странновато) В Projects Claude уже сам понимает, к какой сессии отнести задачу, а effort по промпту мы по-прежнему должны настраивать самостоятельно.

Ждём для effort что-то вроде Auto mode для аппрувов, ну или настраиваем Jev.

@ai_for_devs
Post #531 6

Forwarded from Данил Щуцкий | CutCode AI

Ошибка, которую одобрили все

Интересную ситуацию сегодня анализировал.

Есть продукт, где LLM интегрирована практически в каждый этап пайплайна. Сегодня обнаружилась занятная история:

— на этапе разработки допустили ошибку
— на QA эту ошибку покрыли автотестом как правильное поведение
— code review с LLM тоже ничего не нашёл
— в итоге весь пайплайн успешно прошёл, а LLM на каждом этапе при наличии спеки провалидировала результат и пропустила дальше

Я начал раскручивать цепочку назад, чтобы понять, где именно появилась ошибка.

И в итоге дошёл до самого начала — ТЗ.

Изначальная задача была про обработку заказов. Заказы приходят из внешнего мира через шину, мы их сохраняем и маппим под структуру нашего сервиса. Никакой классификации заказов в первоначальном ТЗ не было.

Задачу сделали, написали тесты, всё работает.

Через некоторое время прилетает маленькая задача со скудным ТЗ: забыли учесть, что через ту же шину приходят ещё и возвраты, поэтому у товарных позиций возврата нужно проставлять соответствующий статус.

И вот здесь начинается самое интересное.

Из контекста предметной области довольно логично следует, что возврат — это не просто другой статус товарной позиции. Нужно ещё разобраться с тем, что сейчас на продажу и возврат создаются отдельные заказы.

Но в ТЗ этого нет.

Разработчик увидел простую задачу и практически полностью делегировал её LLM. А LLM сделала ровно то, что попросили: проставила статус.

Code review с LLM прошло — противоречий ТЗ нет.

QA написал автотесты — и они тоже проверяют ровно то поведение, которое описано в ТЗ.

В итоге получился прекрасный комбайн, где каждый этап что-то валидирует, всё зелёное, все довольны — а система делает неправильную вещь 😁

И самое интересное: рой агентов здесь, скорее всего, тоже ничего бы не изменил.

Можно поставить одного агента писать код, второго — тесты, третьего — ревьюить, четвёртого — проверять соответствие спеке. Они могут идеально проверить друг друга и коллективно приехать ровно туда, куда их отправила неправильная или неполная постановка.

Можно делегировать написание кода, автотестов, ревью, приведение ТЗ к единой структуре и ещё кучу механической работы.

Но нельзя ментально выйти из процесса.

Кто-то всё равно должен понимать контекст на каждом этапе и проверять не только «соответствует ли результат ТЗ», но и задаваться вопросом: а правильную ли проблему мы вообще сейчас решаем?

И после таких историй я ещё меньше понимаю рассказы в духе: «сижу PM/CTO, запустил рой агентов, они там сами разработали продукт, а я иногда смотрю на результат».

Без человека, который действительно погружён в контекст, такой рой может оказаться просто очень эффективным способом быстро и качественно сделать не то 😁

В общем, интересный сегодня был анализ.

А ещё я был на созвоне в кафешке, после созвона оставил наушники на столе и спокойно ушёл.

Потом тоже анализировал свою беспечность и пытался найти, на каком этапе пайплайна произошла ошибка.

Но тут, в отличие от истории выше, root cause так и не нашёл))
Post #530 9

Forwarded from Склад программиста

🪐 Markdown с суперспособностями Quarkdown

Нужно готовить контент в разных форматах — книгу, сайт, презентацию и научную статью — но держать всё в одном месте? Quarkdown решает эту проблему, превращая Markdown в полноценную систему вёрстки с функциями и логикой.

Проблема: обычный Markdown ограничен статичным контентом и не подходит для сложных публикаций. Решение: Turing-полный Markdown с функциями, переменными, циклами и условиями. Можно писать код прямо в разметке, создавать свои библиотеки и компилировать один проект в PDF, HTML, презентацию или интерактивную базу знаний.


Подходящий инструмент для авторов, разработчиков и исследователей, которым нужно гибкое управление контентом без переключения между разными редакторами 🚀

🐱 Перейти на GitHub

👨‍💻 Склад |🌟Блог админа | #Markdown #Tools #Разработка
Post #529 5

Forwarded from AI for Devs

⚡️ Модель Jev от TypeSafe AI стала доступна всем

На старте дают $5 на API-счет (~120млн.токенов). Стоимость: $0,042 за млн входных и бесплатные выходные токены.

Дока по использованию: https://docs.typesafe.ai

Также на Vercel можно потестить бесплатно до 25 сентября.

@ai_for_devs
Post #528 5

Forwarded from taras.one - all about frontend

🌈 Ваши if никогда не будут прежними.

TypeSafe AI представила модель Jev, которая не умеет генерировать текст. Вместо этого она принимает состояние приложения, отвечает на заранее заданные вопросы и возвращает типизированные решения с вероятностями.

Основатель TypeSafe, Diogo Almeida, ранее работал в OpenAI над методами обучения моделей следованию инструкциям. Теперь он предлагает пойти в противоположном направлении: вместо ИИ, который общается с человеком, сделать ИИ, который становится частью программной логики.

TypeSafe AI вводят на рынок новый класс моделей, System One Models, они вдохновились книгой Thinking, Fast and Slow, Даниэля Канемана. Название класса моделей отсылает к различию между быстрым, интуитивным мышлением Системы 1 и медленным, осознанным мышлением Системы 2.

TypeSafe AI назвали проект - Jev в честь Уильяма Стэнли Джевонса:
> "Мы полагаем, что развитие машинного интеллекта пойдет по тому же пути, что и история использования угля: повышение эффективности паровых двигателей привело к росту спроса на топливо. Каждое снижение стоимости интеллекта на порядок открывает возможности для его применения в сценариях, число которых также возрастает на порядки."

😵‍💫 Как это работает?

Допустим, у вас есть обращение пользователя. Вместо того чтобы отправлять его в LLM с просьбой вернуть JSON, вы передаёте Jev состояние и несколько вопросов:


// App state
{
"food": "Russian butterbrot",
"definition": "A traditional Russian butterbrot consists of a single slice of bread with butter spread on top. It is served open-faced, without a second slice of bread."
}

// Questions
{
"is_sandwich": {
"type": "noul",
"instructions": "Is `food` a sandwich?",
"criteria": {
"true": "A sandwich is a food dish where a filling, such as meat, cheese, vegetables, or spread, is placed between structural starch",
"false": "The food has no bread enclosing a filling or uses only a single slice of bread, or uses a non-bread wrapper such as a tortilla, wafer, or cookie."
}
}
}

// Responce
{
"model": "jev-1.13.0",
"answers": {
"is_sandwich": {
"type": "noul",
"noul": 0.06,
"stats": {}
}
},
"usage": {
"input_tokens": 384,
"output_tokens": 23
},
"request_id": "playground_1142bf71213445486bec078065ffd2e",
"evaluation_time_ms": 102.2991350000666
}


Судя по ответу Jev думает что бутерброд у нас с вероятностью 6% сэндвич, что можно интерпретировать как false, ну или true в зависимости от того какой if вы у себя в логике напишите.


const probablySandwich = response.answers.is_sandwich.noul

if (probablySandwich > 0.8) {
addCoffeeToCart()
} else {
addBlackTeaToCart()
}


Никакой генерации текста, парсинга ответа и борьбы с внезапными галлюцинациями в JSON.

Ещё интересен подход к обучению. Вместо привычного RLHF разработчики используют RLCD - Reinforcement Learning for Calibrated Decisions. Модель учат не просто выбирать ответ, а оценивать собственную неопределённость.

По задумке, приложение сможет самостоятельно обрабатывать очевидные случаи, а сомнительные отправлять человеку 🛑

Что по производительности?

😱 Разработчики заявляют:

• 70–500 мс на запрос
• $0,042 за миллион входных токенов
• Бесплатные выходные токены

В собственных тестах они также получили ускорение до 193,6 раза и снижение стоимости до 444,6 раза по сравнению с LLM. Правда, сами признают, что это верхняя граница ожидаемого выигрыша, а тестовые сценарии составляла их команда 🪨

И важный нюанс: Jev гарантирует соответствие ответа схеме, но не правильность самого решения. type-safe !== correct 😏

А вы готовы доверить Jev свои if'ы? 😯
Post #527 10

Forwarded from ИИ & Право

📖 Полезный источник новых ИИ-терминов

TechCrunch опубликовал глоссарий, объясняющий постепенно появляющиеся новые термины, связанные с ИИ. Например, глоссарий содержит объяснение таких терминов как opaque recurrence, neuralese, recurrent depth, Mixture of Experts, token throughput и memory cache.

#ИИ #AIGovernance #AIRegulation #TechLaw
TechCrunch Opaque recurrence, and other AI terms that you should probably know | TechCrunch The rise of AI has brought an avalanche of new terms and slang. Here is a glossary with definitions of some of the most important words and phrases you might encounter.
Post #526 10

Forwarded from Радио Sputnik

Нельзя запрещать детям использовать ИИ в начальной школе, считает Максим Горшенин

"Если ребенка заранее тренировать, давать ему работать с искусственным интеллектом, то он поймет, что это не магическая штука, которая знает ответы на все вопросы и ему не надо ничего учить.

Он будет понимать, что ИИ знает только то, что в него положили, а положить в него могут что-то плохое. Значит нужно перепроверят и включать критическое мышление.

А если запрещать в начальной школе пользоваться ИИ, то мы перестанет видеть школьников на международных олимпиадах, потому что они будут отставать от других детей, которые пользуются с самого детства таким помощником.

Ведь они будут больше информации усваивать, раньше ее усваивать и быстрее анализировать", — объяснил блогер.

✅ Полную версию смотрите в ВК и RUTUBE

📌Подписаться на Радио Sputnik в МАКС
Post #525 17

Forwarded from Злой полицейский (Mikhail Kobzarev)

Обзор инструментов управления AI-агентами

Параллельный запуск AI-агентов перестал быть экзотикой, но управлять ими вручную неудобно. Разбираем Herdr, Orca, Emdash, Superset и другие среды для агентов: чем они отличаются, кому подходят и почему Herdr — лучший выбор для тех, кто работает в терминале.

Ещё год назад хватало одного Claude Code или Codex в отдельном окне терминала. Сейчас типичный сценарий выглядит иначе: один агент рефакторит модуль, второй пишет тесты, третий чинит CI, четвёртый обновляет зависимости. Каждому нужна своя рабочая директория, свой Git-раздел (worktree) и свой терминал.

Если запускать всё это вручную, вы утонете в переключении между вкладками. Именно поэтому появился целый класс инструментов — среды разработки для агентов (ADE, Agent Development Environment). Они решают одну задачу: дать вам единое место, откуда видно всех агентов сразу.

Но внутри этого класса уже наметился раскол:

• Графические среды — полноценные приложения с окнами, панелями, встроенным редактором и браузером.
• Терминальные среды — работают прямо в вашем терминале, не требуют отдельного приложения и встраиваются в уже привычный рабочий процесс.

Понимание этой разницы важнее, чем запоминание списка функций. Ниже — разбор основных игроков.

👉 https://www.kobzarev.com/ai/agent-tooling-overview/

#ai #agents #review

👮‍♂️ Злой полицейский
Post #524 8

Forwarded from Код.ру

🤐 ИИ присвоил себе заслуги чужой работы?

Решение «задачи тысячелетия» от OpenAI попало в крупный скандал.

📌 По версии OpenAI, её новая модель за 88 часов смогла решить одну из семи самых сложных задач в мире. Но ранее над той же задачей год работали два математика, и все черновики они загружали в Codex, инструмент OpenAI.

📌 Теперь они обвиняют компанию в том, что их беседы попали в обучающие данные для новой модели и она украла их решение. Причём решение ИИ действительно похоже на их метод.

В тем временем в соцсетях разгорелся скандал из-за приватности данных.

Разобрали подробно что произошло по ссылке:

↖️ https://kod.ru/openai-mogla-ukrast-reshenie-slojnoi-zadachi
Post #521 7

Forwarded from Data Secrets

⚡️ Только что вышел DeepSeek-V4.1-Flash
Post #520 8

Forwarded from Веб-страница

Bun на 2000 параллельных сборках стал есть 609 МБ вместо 6,7 ГБ

Если вы упирались в память, когда Bun собирает много всего разом, в версии 1.4.0 потолок сдвинулся: на том же бенчмарке расход упал с 6,7 ГБ до 609 МБ. Заодно порт закрыл 128 старых багов и примерно на 20% ужал бинарник на Linux и Windows.

Ядро рантайма переписали с Zig на Rust, чтобы обращения к освобождённой памяти ловил компилятор. Переписывала не команда: 64 агента в параллельных git-worktree за 11 дней перевели 535 496 строк Zig и разгребли 16 000 ошибок компиляции. API обошёлся примерно в $165 000, а Turborepo с Go на Rust переводили 3–5 инженеров 14 месяцев.

Цифры порта собраны на dev.to.

#javascript #ии
Post #515 8

Forwarded from Data Secrets

Пошел слух, что OpenAI решили одну из задач тысячелетия

Речь про Навье-Стокса, и с этой историей разразился настоящий скандал.

Два математика – Тристан Бакмастер из NYU и Левент Алпеге из Anthropic – год работали над этой задачей, и обнаружили доказательство коллапса решений для уравнений Эйлера – это родственная, но более простая задача, чем сам миллениум. Тем не менее, это очень большой результат и ощутимая подвижка в прогрессе по Навье-Стоксу.

В частности, Теренс Тао назвал работу Бакмастера и Алпеге выдающимся достижением и сказал, что не видит препятствий для распространения метода на самого Навье-Стокса.

В сообществе почти сразу пополз слух, что кто-то близок к прорыву по Навье-Стоксу. Многие приписывали это Anthropic, и Бакмастер решил лично написать в OpenAI знакомому математику и прояснить ситуацию, сообщив, что это его личный, а не корпоративный проект. Мотивом было сохранение академической прозрачности, но этот жест доброй воли стал переломным моментом.

Как говорит сам Бакмастер, после этого OpenAI начали работу над своей (более сильной) версией результата. Через несколько дней ему сообщили о том, что их внутренняя модель нашла контрпример для Навье-Стокса (потенциально миллениум), используя тот же метод, который выбрали Бакмастер и Алпеге.

Доказательство ему не показали, а когда математик спросил, когда был отправлен первый промпт по этой задаче, выяснилось, что это произошло уже после того, как информация об их с Алпеге работе дошла до OpenAI.

Кроме того, Бакмастер подозревает, что OpenAI могли воспользоваться данными из его переписки с Codex, куда он загружал все файлы проекта. Когда он спросил об этом в переписке, то прямого ответа так и не получил.

Затем Бакмастеру, по его словам, предложили два варианта: либо скоординированное совместное объявление, либо он один пишет результат, указывая модель OpenAI в качестве источника. При этом Себастьян Бубек из OpenAI дважды настаивал на исключении Алпеге из авторов, ссылаясь на «раздражающий» факт его работы в Anthropic.

Бакмастер отклонил оба предложения, и в итоге из-за давления они с Алпеге опубликовали свои результаты по уравнениям Эйлера раньше срока, чтобы точно зафиксировать авторство: https://mastodon.social/@tristanbuckmaster/117233413705701198

Бубек публично назвал обвинения ложными и провокационными и сказал, что действовал по академическим нормам, пообещав дать более полный ответ позже. За него также вступился Ноам Браун, заявив, что все лабы должны жить дружно 🥰

Прямо сейчас в X идут многочисленные перепалки по этому поводу, в том числе между сотрудниками OpenAI и Anthropic.

🍿
Older posts →

About this channel

How can I read @dealenxfeed without a Telegram account?
TGViewer shows the public web preview Telegram publishes for 𝘋𝘌𝘈𝘓𝘌𝘕𝘟 ⚡️ Одобряет!: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does 𝘋𝘌𝘈𝘓𝘌𝘕𝘟 ⚡️ Одобряет! have?
𝘋𝘌𝘈𝘓𝘌𝘕𝘟 ⚡️ Одобряет! (@dealenxfeed) has 23 subscribers on Telegram, refreshed roughly every 30 minutes.
Does 𝘋𝘌𝘈𝘓𝘌𝘕𝘟 ⚡️ Одобряет! know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →