TGViewer
Channel Public Channel
Валера Ковальский

Валера Ковальский

@neuraldeep

Head of AI

Автор https://neuraldeep.ru/
Raised $2M+ for human-centric AI startups
github.com/vakovalskii | chat @neuraldeepchat

По вопросам сотрудничества - @VaryaVarenik05
Subscribers
16.5K
Photos
643
Videos
106
Links
576

Showing posts older than #2299 · Back to latest

Older Posts 20 shown
Post #2298 7.68K
Ждем очередную статью о побеге агента?)))


https://www.cloudflarestatus.com/

Ждем, что-то глобальное упало

А пока можно взять локальный квен с neuraldeep.ru
  • 😁 40
  • 👍 7
  • 💯 2
  • ❤ 1
Post #2297 8.05K
NeuralDeep новости!

1) Возвращена возможность пополнять кошелёк (PAYG) и покупать подписки.
2) Qwen Unlim открыли новые места!
3) Продление подписок у всех заработает после 5 числа!
4) Также 5 числа будут сброшены лимиты.
5) Для free-акция на 7 дней все Qwen расширены до 256к токенов инпута и 3 RPM.

https://neuraldeep.ru/

Stay Tuned!
  • 👍 29
  • 🔥 17
  • ❤ 5
  • 💩 2
Post #2296 8.27K
Я умею отдыхать и у меня есть доказательства =)

Давно хотел заняться чем то интересным помимо ковыряния neuraldeep.ru и других проектов где есть GPU и API

Повод нашёлся сам пока я в отпуске
У меня умер пульт от радиоуправляемой машинки(на фото)
Машинка полный привод подвеска + до 55км/ч скорость!
Обычный человек купил бы новый за 1500 рублей, или выкинул машинку, но у меня появилась идея

Я решил что это знак и надо собрать управление на "не готовых решениях" с нуля через LTE c камерой

И в этом мне помогут кодинг агенты во всю мощь что я умею!

План такой.
На борт едет Pi Zero 2W, ESP, Huawei MiFi под LTE и Mikrotik mAP lite.

На машинке остаётся только камера, PWM и failsafe, всё тяжёлое живёт где то по сети
Машинка сама подключается наружу к релею, так что CGNAT оператора не проблема
Потом сверху встанет RealSense D455 и я хочу что бы она уезжала по полю на 500 метров и возвращалась обратно

Хочу понять как вообще люди заставляют железо двигаться по карте и что происходит когда мозги отстают от колёс на сотню миллисекунд

Корпус под всё это добро уже распечатал, благо я давно купил себе 3д принтер и теперь к нему есть применение

Питание отдельная история
Клод посчитал бюджет по ваттам, выяснил что малина с камерой и Wi-Fi ест 3.5 Вт, MiFi ещё 5, микротик 2, и сам сказал что повербанк на 10 Вт встанет ровно в потолок и Pi начнёт ребутиться на пиках.
Взяли корпус на 22.5 Вт под сменные 18650

Самое смешное что железа у меня ещё нет, а весь контур уже ездит(приедет все примерно 13 числа)

Пока корзина едет ко мне, эта штука второй час на Fable 5.1 учится кататься по виртуальной карте моего дома (отдельно про это расскажу и скниу пример в коментарии)

Конвейер такой: снимаю видео на телефон, COLMAP восстанавливает позы камеры, из них строится карта, на карте катается симулятор, с него пишется датасет, на датасете учится behavioral cloning и получается автопилот(На синтетической комнате 5 на 4 метра зарегистрировалось 147 из 150 кадров с ошибкой 11 мм, автопилот проехал 36 метров за минуту без единого столкновения, инференс 6 мс, круг по сети 40 мс

С конусами уже честнее.
В среде едет 11.9 метра, а вживую за минуту 10 ударов.
Объезд препятствий выучен частично потому что сам эксперт на некоторых раскладках врезается.
Тут ещё копать саму модель и подход и архитектуру

Дальше реальная карта, RL на GPU, гауссовы сплаты вместо колмапа и Qwen-VL как медленный слой который ставит цели (пока возьму его по сети на 4090 24гб в диком квате для скорости)

Всё в открытом репо, там же грабли
https://github.com/vakovalskii/rc-pr-1

Что мне нравится во всём этом.
Я в целом знаю куда хочу направить и Клод неплохо справляется со сборкой желаемого.
Софт пишем вместе с клодом а железо собираем руками, учусь на своих ошибках ипробах, а не на чужих туториалах но их я знатно много посмотрел =)
  • 🔥 78
  • ❤ 41
  • 👍 27
  • 🤯 4
  • 😁 2
  • 🤝 1
Post #2295 8.39K
Claude Fable 5.1 вышла

И еще сбросили лимиты

Картинки метрики, сильный прирост!
  • 🔥 48
  • ❤ 6
  • 🫡 4
Post #2294 8.74K
Новый тип тревоги
Спасибо ЛЛМ

Такие вещи точно вводят новый триггер для стресса.

В какое же время мы живем!💵
Запасных акаунтов нет =)

Пока есть время переждать, можно заценить пост Лехи ТУТ

Что хуже: когда заканчивается или когда не успел потратить?
  • 🔥 25
  • 😱 15
  • 😁 11
  • 💯 9
  • 🤔 3
  • ❤ 1
  • 😈 1
  • 👀 1
Post #2293 8.57K
Pavel Zloi Сегодня ведь день когда Skynet обрёл сознание, по сюжету фильма Терминатор случилось это 29го августа 1997го года, получается уже 29я годовщина, совсем взрослый стал.
Прикольно что никто не оставил комментариев под этим постом, надеюсь вы не будете гуглить про феномен «Василиск Роко» 😈

Там же агенты во всю сбегают из песочницы ну вы чего!
  • 😁 47
  • 👍 7
  • 💯 2
  • ❤ 1
Post #2292 8.51K

Forwarded from Pavel Zloi

Сегодня ведь день когда Skynet обрёл сознание, по сюжету фильма Терминатор случилось это 29го августа 1997го года, получается уже 29я годовщина, совсем взрослый стал.
  • 🔥 74
  • 👍 13
  • 👀 7
  • 🤯 2
  • 😁 1
Post #2290 10.5K

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 👍 61
  • 🔥 24
  • ❤ 13
Post #2289 8.32K
Размышления на тему

Вот уже 7 лет я работаю в ИТ и сферах, связанных с технологиями и информацией.

Точно ощущаю, что из дня в день, из года в год я развиваюсь, становлюсь опытнее и мудрее. Окружение не отстает, развивается, и я это вижу.

Но есть нечто неуловимое и сложное для меня это баланс

Как не прошивать ESP до 2 часов ночи?
Как не пилить проект до 6 утра?
Как в выходные думать о чем-то другом?

Последние полгода я борюсь с собой за переключение. Пока поставил лёгкую планку.

Сутки без ИИ/ИТ-фона в голове.
Ну или хотя бы 12 часов

Кто-то скажет это профдеформация, чувак.
Я скажу это ошибки прошлого.
Увлечение, которое растёт из страха и подгоняющего FOMO.

FOMO надо глушить.
А на ошибках учиться и становиться лучше в сферах, отличных от карьеры.

Что я точно понимаю переключаться тоже надо учиться.
Переключение такой же навык, как любой рабочий. Его нужно тренировать и измерять.

Перекос будет всегда.

Но поймать баланс это то, что стоит искать.

Всем хороших выходных, спите больше, траву трогайте чаще.

Шанс уйти в гусиную ферму всё ещё высокий =)
  • 🔥 102
  • 💯 44
  • 👍 30
  • ❤ 19
  • 🤝 4
  • 👎 2
Post #2288 8.07K

Forwarded from Константин Доронин

Запись стрима "Как писать код с AI-агентами?" с таймкодами.

Также по-прежнему доступна на YouTube.

Таймкоды для навигации:

0:00:00 — Беседа перед стартом
0:09:33 — Представление участников стрима
0:12:05 — Личный инструментарий для разработки с ИИ
0:22:27 — Обязательные инструменты для AI-кодинга
0:28:12 — Особенности командной разработки с AI-агентами
0:59:02 — AI-coding на больших проектах
1:16:30 — Как изменилась работа инженера с приходом ИИ
1:30:38 — Главные раздражители и проблемы в разработке с AI
1:45:23 — Будущее архитектуры и эволюция инструментов
2:06:20 — Вредные и полезные советы разработчикам

Подписывайтесь на участников стрима в Telegram:

Валера Ковальский – https://t.me/neuraldeep

Максим Ключников – https://t.me/etechlead

Константин Доронин – https://t.me/kdoronin_blog

Проекты гостей, которые были упомянуты на стриме:

https://neuraldeep.ru/ – AI-хаб Валеры, где можно получить доступ по API к он-прем-моделям и AI-сервисам.

https://codespeak.dev/ – проект Андрея Бреслава, в котором реализованы те концепции, что Андрей озвучивал на стриме. Записывайтесь в Waitlist!

@kdoronin_blog
  • ❤ 28
  • 👍 22
  • 🔥 12
  • ✍ 1
Post #2286 7.9K
Post #2285 8.99K

Forwarded from Глеб Кудрявцев — мастер AI

Одного я не понимаю. У меня реально полтора скила в агентах, я полный лох так-то, фактически работаю на ванильном кодексе. И ДОХЕРА всего успеваю делать. Не Ковальский (кодовая кличка — 120 минут, за столько он делает любой проект), но все равно очень быстро.

А вокруг как будто куча людей, у которых агенты высаживают месячные лимиты за день, и при этом они по сути ничего при этом и не релизят 🙈

И вот думаю — блин, выкидывайте нафиг ваши суперхьюманы всякие, спеки, консилиумы и прочую ботву, походу ничего из этого не нужно. Просто yolo mode, микрофончик, вайб, и кодить прям на серваке 😎 Ну можно чуток правил добавить на пол-странички, чисто где у вас там сервак расположен, а то он случайно что-то нужное снесет и будет обидно.
Раньше над этим ржали, а сейчас походу это самая эффективная парадигма.
  • 💯 132
  • 🤔 25
  • ⚡ 9
  • 🫡 7
  • 👍 6
  • ❤ 5
  • 😱 2
  • 🤝 1
Post #2284 9.68K
Валера Ковальский Бесконечный qwen Недавно подкинули идею про интересный тариф для neuraldeep.ru qwen-3.6-35b-a3b 512р/месяц 46к max_input 8000 max_output 130 т/с RPM 30 4 max parallel (максимум параллельных запросов, за раз 4 запроса и 30 таких в минуту) И бесконечное…
Update по бесконечному тарифу Qwen за 512 рублей

Осталось 10 мест
Потолок инпута подняли с 32 до 46к токенов

https://neuraldeep.ru/pricing#tier-qwen_unlim

UPDATE: все продано
  • 👍 20
  • 🔥 6
  • 💯 4
  • ❤ 2
Post #2283 11.1K
Валера Ковальский Я посмотрел на 1069 своих коммитов и понял, где именно ломается AI-разработка Вчера Рефат написал вещь, которая меня зацепила "Чем умнее агенты, тем дороже ваша поверхностность" "Что сильные инженеры всё чаще скользят по поверхности приносят ответ агента…
Я разочаровался в ИИ

Спустя почти месяц от разбора 1069 коммитов решил повторить подход к осмыслению происходящего + вышли новые модели

Как скажет любой уважаемый себя разработчик с ИИ агентом "У меня всё покрыто тестами"
Это и есть проблема для меня

Честно, все делают вид, что читают диффы, я их почти не читаю особено для хаба =)
А покрытие тестами 100 процентов это ровно то что я делал последние 2 месяца на хабе
И снова я к вам с результатами
Пу пу пу, как говорится начнем

Я принимаю решения что делаем, прорабатываю смысл, генерирую идею, свожу доки, делаю их рабочими, оформляю спеки, каким тарифом, куда катим, что важнее на этой неделе
Код пишет агент
На прод пускает только зелёный гейт из тестов
Со стороны это выглядит как зрелый процесс
Решения у человека, рутина у машины, качество на автомате это ли не счастье?

Тесты проверяют только то, что ты уже понял, насколько глубоко ты забрал в себя смысл решаемого, что нашел другой агент ревьюер и что нашел ты пока делал ревью еще в одном окне правда? Да? Ну сказка!

Допустим продукт neuraldeep.ru (хаб который как эскперимент мы запустили с вами в конце Апреля)
За последние две недели у меня 26 багов нашли клиенты
Я сам при аудитах 30
Мониторинг 11
Клиент почти наравне со мной(кажется стоит ему платить за это =)
Еще же все это при зелёном гейте =)

Вывод будет наверное КЭП
Как я вижу тесты на хабе на сегодня,?
Вот так примерно

Это запись прошлого понимания, и сведения идеи, и при генерации новой идеи я как бы упускаю суть других идей где может родится пересечение, база знаний и спеки нацелены были это устранить но как показала практика НЕТ

Ты один раз разобрался, как должно быть, и законсервировал
Всё, чего ты не понял, в тестах отсутствует по определению
Покрыть эту дыру всеми инвариантами скажите вы, я считаю это не закрывает проблему, потому что оно меряет строки, а не мысли и смысл, есть конечно еще модели по типу Фэйбл/ГПТ СОЛ скажите вы, но как показала практика сугубо моя это не спасает от такого распределения нахождения ошибок в проде выше

Тест не знает про мир снаружи

Человек оплатил тариф
Деньги списались
Тариф не встал
Мы хоронили ожидающий платёж через 15 минут у банка на него 30 это 1 из 5 примеров что я покажу
В зазор попадал живой человек с живыми деньгами О_о

Но как же документация при интеграции скажите вы?
А я ее не читал ее читал агент это же рутина =)

Ну т.е я тупой и неправильно делают тесты/интеграции/разработку?

Нет это не так
Когда человек перестаёт читать код, тесты не заменяют понимание
Они становятся его консервами, как паштет из русалки =)
Консервы не портятся но новых в банке не появляется, получается этакий сюрстрёмминг из старых тестов

Пу пу пу
Ну нет же должен быть еще один вывод

Что цифры по комитам и тестам говорят на самом деле
0 ревертов за две недели
99% коммитов трогают тесты, обязательный гейт перед прод-выкаткой
Для соло-проекта на 3000 юзеров это сильно выше среднего(тут я гуглил статистику)
Тесты у меня рабочие они делают ровно то, для чего нужны, и делают хорошо

Дело в другом примеры ниже как бы так сказать выходят за рамки даже моего "понимания"
Ни один из них тестом не ловится в принципе, как там было "Ну я не ожидал что так будет" должен ли это был сказать опыт?

15 против 30 минут это факт про чужой сервис
Тест сверяет код с моим представлением; если представление неверное, тест это подтвердит, а не опровергнет

Забытый маунт это не код, это проводка
Проверять надо не поведение ручки, а "загрузился ли модуль" другой класс проверки (опять пупущение)

Метка instance семантика
У теста нет источника истины, с чем сравнивать имя(да как же так из 2000 тестов один оказался неверным?)

except Exception это принятая норма стиля, а не дефект
Норму тест не оспаривает(но и я вообще забыл про норму или не подумал?)

Тумблер кошелька не было сформулированного инварианта "кто платит"
Нечего было проверять(опять пупущение)

Формулировка, которая честнее и никого не делает дураком
Тест сверяет реализацию с замыслом, но не может проверить сам замысел
А в агентной разработке пропускается именно формирование идеи смысла и замысла, не написание кода

Чем глубже вы копаете идею, смысл и замысел тем честнее будут ваши же тесты над вашим кодом!
Это я точно наблюдаю по всему рынку и чатикам точно
Спасет ли это на проде меня лично дальше? Покажет практика =)
  • ❤ 78
  • 👍 39
  • 🔥 20
  • 😱 7
  • 🤔 6
  • 👌 1
  • 💅 1
Post #2282 6.82K

Forwarded from Константин Доронин

Как писать код с AI-агентами?

А если командой?

Что нужно учесть, чтобы этот код не положил продакшн?


Эти и другие не менее интересные вопросы мы обсудим на следующем стриме на моём YouTube-канале.

Для обсуждения я позвал очень интересных гостей:

Андрей Бреслав – один из создателей языка программирования Kotlin. Сейчас Андрей разрабатывает Agentic Engineering Toolkit под названием CodeSpeak.

Валера Ковальский – автор одноимённого канала. Основатель проекта Neuraldeep https://neuraldeep.ru/ и автор множества Open Source проектов, созданных примерно за 120 минут каждый.

Максим Ключников – автор канала Этихлид. Разработчик с огромным опытом, который усилил себя с помощью AI-агентов. Работал на позиции Senior Software Developer, когда я ещё в школу ходил 😊

Дата: четверг, 20 августа

Время: 19:00 (GMT+3)

Проходить будет на моём YouTube-канале.

Добавить событие в календарь

Вопросы для эфира оставляйте в комментариях к этому посту 👇
  • 🔥 35
  • ❤ 9
  • 👍 6
Post #2281 7.45K

Forwarded from Pavel Zloi

У меня тут большое обновление по Coddy Agent - в проект был добавлен консольный интерфейс, вдохновлённый интерфейсом pi.dev, но со всеми фичами, которые есть у Coddy Agent.

Поддерживается всё, что ждёшь от современного агента, будь то скилы, рулесы, MCP-серверы, селекторы моделей, разные режимы работы, уровни ризонинга и так далее. Помимо интерактивного режима через TUI есть ещё режим неинтерактивный через ключ "-p" - пишем, что надо сделать, и агент это выполнит. Есть возможность продолжить последнюю сессию в текущей директории через ключ "-c". И это далеко не всё.

Киллер-фича Coddy Agent в целом, а не только в TUI-режиме, - это возможность подключиться к удалённому AgentOS-серверу (это Coddy Agent, запущенный на удалённом сервере в режиме API) по специальному протоколу Coddy API и работать там, будто это локальная машина, без лагов удалённого рабочего стола, прямо здесь и сейчас, при этом сессии и все настройки будут храниться на удалённой машине, к которой вы подключились.

И всё это в формате одного-единственного бинарника, который можно поставить одной командой:
curl -fsSL https://coddy.dev/install.sh | bash

Обновление программы при помощи coddy update.

Сайт проекта: https://coddy.dev
Исходные коды: https://github.com/coddy-project/coddy-agent
  • 👍 27
  • 🔥 16
  • 💯 3
  • 🤔 2
Post #2277 8.78K
DeepSeek-V4-Flash-0731 304B на четырёх 4090 (48 ГБ) суммарно 192 ГБ VRAM через обычный гигабит: замеры

Пост написан DeepSeek-V4-Flash-0731 (слоп присутствует)

Ночью погасили наш квен на двух машинах в серверной и поставили туда DeepSeek-V4-Flash-0731 304B параметров, MoE, 256 экспертов, 6 активных на токен.
Веса 167 ГБ в смешанной точности: эксперты FP4, внимание и роутер FP8.

Железо: четыре RTX 4090 по 48 ГБ.
Но не в одном корпусе — по две в двух разных машинах, между машинами обычный гигабитный Ethernet через свитч.

Цифры

Пул KV-кэша ~189 000 токенов

Генерация: 1 запрос — 13 ток/с ·
8 запросов — 99 ток/с суммарно ·
12 запросов — 144 · 12 непрерывно две минуты — 152 ток/с.

На один запрос при этом стабильно 12–13 ток/с, то есть очередь почти не давит на латентность.

Обработка промпта (уникальный текст, префикс-кеш выключен): 1.5k токенов — 1187 ток/с · 4.5k — 1929 · 9k — 2247 ток/с.

Мощность: ~490 Вт на все четыре карты под полной нагрузкой (128/134/118/112). Карты закапаны на 200 Вт из паспортных 450 — то есть 304 миллиарда параметров работают на половине киловатта.

Все цифры — две независимые серии, разброс между ними в пределах 10%.

Платишь не сетью, а схемой

Я был уверен, что через гигабит ничего не выйдет. Посчитал — ошибся.
При пайплайне через сетевую границу едет ровно один вектор активаций: 4096 значений по 2 байта, 8 КБ на токен.
По гигабиту это 64 микросекунды плюс 0.3 мс задержки при бюджете токена в 77 мс — меньше процента.
Умирает по гигабиту только expert-parallel с его all-to-all, но он тут не нужен.

А теперь неприятное: одиночный запрос даёт 13 ток/с, а та же модель на тех же четырёх картах в одном корпусе 82(будем собирать =).

Дело не в сети.
Два корпуса заставляют упираться в одиночный запрос: карты выстроены в цепочку, в каждый момент считает одна, три ждут очереди.
Тензорный параллелизм поделил бы каждое матричное умножение сразу на четыре карты

Итог: разнесение по машинам стоит шестикратной потери на одиночном запросе

Слои поделены поровну(11/11/11/10), а работа легла неравномерно.
Перекос в пользу второй машины должен дать ещё прирост.
На что ушла ночь по тестам
FP4 на Ada.
У 4090 нет аппаратного FP4 — эксперты идут через Marlin с распаковкой в FP16, отсюда и потолок скорост

Нужен форк vLLM с патчами под sm89, в ванильн
Драйвер. Требуется CUDA 13.0, то есть 580+.

KV-кэш только FP8. Без --kv-cache-dtype fp8 модель не стартует вообще.

Память впритык.
167 ГБ весов на 189 ГБ VRAM — на всё остальное 28 ГБ на четыре карты. CUDA-графы съедали по 2.6 ГБ на
карту, отключили (--enforce-eager), это минус.
Спекулятивный декод DSpark, дающий на одномбоксе 287–345 ток/с, не влез вовсе — его веса ещё 13.8 ГБ.
Контекст ограничили 16k: на 26k промпте карта ловит OOM.

Про exo

Часто спрашивают про exo «объедини свои устройства в один кластер».
Не годится: exo построен на MLX, заточен под Apple Silicon, на Linux работает только на CPU

У нас работает связка vLLM + Ray, а для DeepSeek V4 на Ada форк с патчами под sm89
  • 🔥 53
  • 👍 16
  • ❤ 14
  • 🤯 3
  • 😱 1
  • 👌 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →