TGViewer
Channel Public Channel
very vibe coding

very vibe coding

@veryvibecoding

Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Subscribers
117
Photos
457
Videos
126
Links
970
Recent Posts 14 shown
Post #1582 13

Forwarded from Data Secrets

Яндекс открыл веса новой языковой модели AliceAI-Foundation-80B-A3B-Base

Модель обучена полностью с нуля, без использования весов сторонних опенсорс-моделей. По метрикам она обходит куда более крупные DeepSeek-V4-Flash-Base и Nemotron-3-Super почти по всем направлениям, а среди открытых претрейнов лидирует на IMO AnswerBench и LiveCodeBench. Свою же предыдущую закрытую версию на 235B она обгоняет по фактам, математике, коду и длинному контексту при почти втрое меньшем числе параметров и в семь раз меньшем количестве активных.

Про то, как команда добилась таких результатов, нам удалось послушать на выступлении Екатерины Рединой в субботу на Practical ML Conf. Екатерина работает руководителем группы исследования знаний в службе качества претрейна Alice AI, и вот несколько интересных деталей, которые она раскрыла про процесс претрейна:

1. У команды был собственный scaling law: формула, которая по размеру модели и объему данных предсказывает, какие гиперпараметры (например, batch size) дадут лучший результат. Эта штука максимально важна, потому что перебирать варианты руками слишком дорого.

Чтобы проверить закон, команда обучила модель с вдвое меньшим batch size. Должно было выйти хуже. Но вышло – лучше.

Проблему искали довольно долго, а в итоге она оказалась на поверхности: сам scaling law строился на том, что модели сравнивали по лоссу, но оказалось, что лосс почти не коррелирует с бенчмарками. Все починилось после того, как инженеры пересобрали датасет для эвала.

2. Для обучения использовали оптимизатор Muon – он экономит FLOPs по сравнению с привычным AdamW, но платит за это дорогой операцией: матрицу весов нужно ортогонализовать целиком, а она у них разбита шардами по разным GPU. Значит, перед каждым шагом надо гонять данные по сети: собрать матрицу, обработать, раздать обратно.

Чтобы GPU не простаивали в ожидании, разработчики написали свой конвейер: пока одна группа карт считает ортогонализацию для одной порции весов, другая уже тащит по сети следующую – вычисления и пересылка идут параллельно. Благодаря этой схеме шаг оптимизатора ускорился почти вдвое.

3. Данные были отдельной больной темой: синтетика то и дело подкидывала забавные побочные эффекты – модель могла выучить неправильную ассоциацию всего по одному обучающему примеру. Например, в QA про возраст был скрытый шаблон: живым к ответу приписывали год рождения, а умершим сразу годы жизни. Модель выучила не факт, а сам шаблон, и на вопрос «сколько лет Тарковскому?» вместо возраста выдавала «1932–1986». Фиксили аугментацией.

4. Вместе с моделью в опенсорс выложили два фактологических бенчмарка - WikiWebFacts и HardMultiQAс акцентом на русскоязычный контекст - и протоколы их оценки.

5. AliceAI-Foundation-80B-A3B-Base – это шаг к единой рассуждающей модели (ЕРМ), на которой будут строиться агентские возможности Алисы. За дальнейшими обновлениями и другими новостями от ML-команды Яндекса можно следить в канале @MLunderhood.

Это только часть того, что рассказала Екатерина. Яндекс выпустил большой технический отчет – там подробно расписан весь путь обучения, с абляциями и разборами подводных камней.

Прочитать его полностью можно здесь: https://habr.com/ru/companies/yandex/articles/1083300/
Post #1581 27
Кстати, если работаете с чем-то кроме Claude и ChatGPT посмотрите внимательнее на OpenRouter - там DeepSeek Flash отдают со скидками и без пиковых часов (от 20 до 60% экономия), GLM-5.3 Flash, кстати, стоит еще дешевле DeepSeek, а Qwen 3.8 27 раздают сейчас вообще бесплатно (также, как и модели Gemma, например, но это еще не самые популярные бесплатные локальные модели - там есть и экземпляры побольше и поумнее).
Post #1580 29

Forwarded from Machinelearning

🎨 Qwen открыла веса Qwen-Image-2.1: новой модели для генерации и редактирования изображений

Модель построена на 7B-архитектуре и объединяет генерацию и редактирование в одном пайплайне.

Что умеет:
• работает сразу с несколькими референсами - до 10 изображений
• поддерживает точечное редактирование с сохранением лица, объекта или продукта
• нативно генерирует и редактирует RGBA с прозрачностью
• подходит для инфографики, панорам, virtual try-on и продуктовых изображений
• улучшена работа с текстом и типографикой
• ускорен inference, особенно для задач с несколькими входными изображениями

Qwen Image 2.1 обходит Nano Banana 2.0, но пока уступает GPT Image 2.5.

И это впечатляющий результат для модели всего на 7 млрд параметров.

https://huggingface.co/Qwen/Qwen-Image-2.1
Post #1577 39

Forwarded from Федор

Jev и OpenJev: зачем агентам модель, которая не умеет говорить

Пока все соревнуются в том, кто лучше генерирует текст, TypeSafe предложила другой слой для агентных систем — Jev.

Jev не пишет ответ токен за токеном. Он получает состояние задачи и набор разрешённых решений, а возвращает одно из трёх типизированных действий:
— выбор из вариантов;
— оценку по шкале;
— ответ «да / нет»;
— плюс вероятность и confidence.

То есть вместо цепочки

LLM → JSON → парсер → retry, потому что JSON сломался

можно сделать так:

state → Jev → choice / score / boolean → обычный код.

Для агента это «умный if»: выбрать следующий tool или субагента, решить retry / stop / ask human, оценить риск действия, отсортировать источники RAG или проверить, нужен ли ручной контроль.

Почему это интересно

Многие решения внутри агентного цикла вообще не требуют красивого текста. Нужен быстрый и строго ограниченный выбор. Jev не может вернуть вариант вне заданного списка — но это не означает, что он всегда выбирает правильный вариант. Ошибки смысла остаются, поэтому нужны other, пороги confidence и fallback на человека либо сильную LLM.

TypeSafe заявляет до 193× меньше latency и до 445× меньшую стоимость по сравнению с LLM-workflow. Это собственные eval’ы компании, а не независимый бенчмарк. Цена в early access — $0,042 за миллион входных токенов; оригинальный Jev пока закрытый и работает как внешний US API.

Аналоги уже появились

Под именем OpenJev возникло несколько независимых открытых проектов:

— один читает logits обычной Qwen3.5‑4B: модель один раз понимает контекст, затем параллельно оценивает заранее написанные варианты без генерации текста;
— другой дообучает Qwen3.5‑4B как NLI cross-encoder: «утверждение следует из текста / противоречит ему / нейтрально»;
— обычные reranker-модели решают более узкую задачу — ранжируют найденные документы, но не являются полноценным диспетчером агентного цикла.

Это не клоны Jev. У открытых вариантов пока нет доказанной калибровки вероятностей и нет гарантии, что они повторяют качество/экономику оригинала. Но как локальный decision-layer они уже интересны.

На базовом Mac mini M4 с 16 ГБ 4B-версия в Q4 поместится без проблем. Это не замена Claude/Codex, а небольшой локальный сервис перед ними: дешёво сортирует поток, а сложное и неуверенное отдаёт сильной модели.

Рабочая схема выглядит так:

жёсткие правила в коде → локальный OpenJev/классификатор → сильная LLM или человек для сложных случаев.

Для российского корпоративного контура это особенно практично: оригинальный Jev лучше не кормить рабочими документами, а OpenJev-подобный слой можно запускать локально или воспроизводить на российском API со structured output.

Оригинальный Jev · Jev в Vercel AI Gateway · OpenJev browser lab · Qwen3.5‑4B OpenJev
typesafe.ai Introducing System One Models & Jev - TypeSafe AI Blog TypeSafe AI is an AI lab building machine-native intelligence infrastructure for automation, designed to make decisions within software. Try our first System One Model, Jev, in early access.
Post #1576 35
Jev похожа на небольшую революцию в нейронках. Думаю, что мы еще очень много об этом услышим. Буду пробовать и разбираться как прикрутить к моим задачам
  • 👎 1
Post #1575 37
OpenAI оптимизировал свою лучшую модель Astra для работы с законодательством. Я уже «испытываю на людях» два нормативных акта, сделанных нейронкой - правда, это был Fable.

С учетом детоксикации от Антропика, попробую теперь писать на Астре. Любопытненько..

PS Это пока доступно только для американских юридических фирм и на американском законодательстве. Но сам харнесс интересный - хочется его разобрать..
X (formerly Twitter) OpenAI (@OpenAI) on X Astra for Law: Frontier intelligence built for your practice. A new offering powered by GPT-6 Astra with tools, settings, and context to support the expertise and judgment of lawyers and legal te…
  • 🔥 1
Post #1574 35

Forwarded from Федор

Exa научила агентов искать в прошлом

Exa запустила Snapshot — поиск по сохранённым версиям веб‑страниц на заданную дату. В API появился параметр snapshotAsOf: можно попросить агента исследовать интернет таким, каким он был, например, 1 июня 2026 года — без материалов, опубликованных позже.

Это решает важную проблему агентских evals. Если сегодня проверять модель на задачах из июня, обычный веб‑поиск может найти готовый ответ в свежем посте, статье или GitHub PR. Snapshot «отрезает будущее» и позволяет понять: агент действительно решил задачу или просто подсмотрел решение.

Другие сценарии: backtesting веб‑сигналов, сравнение старых версий документации, цен, политик, отчётности и публичных заявлений.

Но есть важный нюанс. Exa заявляет 400+ млрд снимков за 20 лет, однако в публичном API сейчас доступно только скользящее окно в 5 месяцев и до 100 запросов. Кроме того, историческим является содержимое страниц, а URL всё ещё отбираются с помощью текущих сигналов ранжирования. То есть это не полноценная Wayback Machine и не точная реконструкция поисковой выдачи на конкретный день.

Для агентов и исследований — очень сильный инструмент: можно делать воспроизводимые тесты и не давать модели выигрывать за счёт знания будущего.

Оригинальный анонс Exa · Документация
exa.ai The Exa API retrieves the best, realtime data from the web for your AI
Post #1573 32
Мультимодальная модель от Qwen и существенное снижение цен. Я для задач по видео-аудио использую DeepSeek, но почему бы не посмотреть и на Qwen 3.8, благо подписку за $20 себе оформил..
Post #1572 39

Forwarded from Федор

Cloudflare открыла skill, который превращает coding‑агента в аудитора безопасности

Это не просто промпт «найди уязвимости». Skill проводит полноценный defensive‑аудит в несколько фаз:

— строит карту архитектуры, границ доверия и поверхностей атаки;
— запускает отдельных агентов‑«охотников» по классам атак;
— отдаёт каждую находку независимому агенту, который пытается её опровергнуть;
— фиксирует результаты в машиночитаемом формате: confirmed, needs_validation, rejected;
— генерирует отчёт только после повторной проверки.

Главная мысль Cloudflare: агент не должен считаться правым только потому, что уверенно назвал «CVE». Подтверждённая находка — это конкретная нарушенная граница доверия и наблюдаемый эффект; отсутствие best practice — лишь рекомендация по hardening.

Важное ограничение: такой аудит требует реального sandbox‑окружения без сети и доступа к боевым системам. Это инструмент для безопасной проверки исходников, а не автономный пентест продакшена.

Для pet‑проектов, API, MCP, auth/roles и supply chain — очень сильный шаблон того, как надо строить агентное security‑ревью.

Исходники skill на GitHub · оригинальный пост Cloudflare
GitHub GitHub - cloudflare/security-audit-skill: A coding-agent skill for multi-phase security audits with independently verified, machine… A coding-agent skill for multi-phase security audits with independently verified, machine-readable findings - cloudflare/security-audit-skill
Post #1571 39
Post #1570 43
Судя по всему, скоро придется использовать и такие ресурсы.. Презентацию не нарисуешь, но сделать исследование - отлично.

Впрочем, OpenAI балует пользователей сбросами лимитов - у меня пара лежит, посмотрите, у вас тоже наверняка есть. Они сгорают за месяц, так что пользуйтесь, когда выбрали лимит
Telegram Вайб-кодинг GPT-6 Astra практически без ограничений??? Пользователи обнаружили, что в Prism, бесплатном редакторе научных текстов от OpenAI, можно выбрать GPT-6 Astra Extra High и продолжить работу даже после исчерпания лимита Codex. Скорее всего Prism использует отдельный…
Post #1560 38

Forwarded from whargarbl

Всем привет!

Обучил адаптер который заменяет Квен-4б на младшего брата Квен-0.6б
в Клейн-4б

https://huggingface.co/AiArtLab/qwen3-0.6b-4b-adapter

Qwen3-0.6B text encoder adapter for FLUX.2-klein-4B
Replace klein's 4B text encoder with a 0.6B one — 7.5 GB VRAM and ~0.3 s/step less.

Те можно разгрузить немного рам и сэкономить бакс-другой на инференсе

Устал как скотина нет сил описывать как я не спал всю ночь дипсик пиная

Вроде неплохо вышло - к моему удивлению даже текст немного тащит в 6 раз меньшая модель. Комфи тоже сгенерил

Может ломаться на редких сложных токенах - все таки я ГПУ-бомж

По качеству +/- как в базе где то лучше где то хуже - без чудес
Older posts →

About this channel

How can I read @veryvibecoding without a Telegram account?
TGViewer shows the public web preview Telegram publishes for very vibe coding: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does very vibe coding have?
very vibe coding (@veryvibecoding) has 117 subscribers on Telegram, refreshed roughly every 30 minutes.
Does very vibe coding know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →