TGViewer
Channel Public Channel
🍳 Датазавтраки ☕️ НСК (Академ)

🍳 Датазавтраки ☕️ НСК (Академ)

@databreakfast

Каждый вторник с 8:30 до 10:00 в "Shurubor coffeeshop" у фонтана ТЦ https://go.2gis.com/wlkqi

По всем вопросам к @promsoft . Рекламу не размещаем
Subscribers
685
Photos
253
Videos
15
Links
1.8K

Showing posts older than #1979 · Back to latest

Older Posts 20 shown
Post #1975 219

Forwarded from kertar

Обсуждали различия версий Qwen3.5. Версии на 27b и 9b используют все свои веса при каждом запросе и могут работать лучше, чем MoE версии, с формально большим числом параметров, но меньшим числом активных.
  • 👍 2
Post #1974 292
07.04.2026 🍳 датазавтрак по вторникам ☕️ в Новосибирском Академгородке с 08:30 до 10:00 в "Shurubor coffeeshop" у фонтана ТЦ https://go.2gis.com/wlkqi
Датазавтрак проведет @kertar1
  • 👍 2
Post #1973 638

Forwarded from Kenny Baum

Для юзеров курсора. Сейчас есть временно бесплатная моделька chatgpt codex 5.3 spark. Работает на быстром инференсе. Неплохо планирует (план лучше перепроверять другими моделями в ask-режиме), но структурно думает на 4, Несложный код пишет на 5-. Придерживается кодстайла. Мне внезапно зашло для линейного кодинга, особенно если сначала она хотя бы в ask-режиме проговорит план.
Раз не жрёт api-кредиты - попробуте, вдруг под под ваши задачи подходит.
  • 🔥 2
Post #1971 306

Forwarded from KertexNotes

Сотрудники Anthropic случайно слили исходники Claude Code, не настроив нормально игнор служебных файлов.

Те, кто покопался, пишут, что там есть много необъявленных фич, вроде режима подумать пол часа и встроенных покемоноподобных питомцев оО.

Подтвердилось, что клод код пишет сам себя, потому что 12 уровней вложенности в функциях это уже за гранью 😁

Надеюсь разработчики других агентских cli оценят вклад Антропик в opensource, и позаимствуют оттуда хороших идей 😁

#ai #fail
ᨒ MindDump Claude Code's Entire Source Code Got Leaked via a Sourcemap in npm, Let's Talk About it Earlier today (March 31st, 2026) - Chaofan Shou on X discovered something that Anthropic probably didn’t want the world to see: the entire source code of Claude Code, Anthropic’s ...
  • 🔥 5
Post #1966 201

Forwarded from Лучше звоните Лоре

✨ ладно это прям большое

Сбер выложил GigaChat 3.1 Ultra и Lightning в опенсорс. MIT лицензия. не research-only, не «для некоммерческого использования» — полноценная MIT

цифры:
— Ultra: 702B параметров (36B активных на токен, MoE)
— по их замерам обходит Qwen3-235B-A22B и DeepSeek-V3-0324 в математике и reasoning
— контекст 131K
— Lightning: компактная версия, для быстрого инференса

что под капотом интересного:
— DPO в нативном FP8 (мало кто так делает)
— нашли и зарепортили баг в SGLang при dp > 1 (то есть реально в продакшене гоняют)
— решили проблему циклов в function calling (знакомая боль)

и вот что меня зацепило — это первая российская модель такого масштаба в полноценном опенсорсе. не урезанная версия, не preview, а production-ready модель с MIT. для сравнения: у DeepSeek тоже MIT, но 671B/37B active. тут 702B/36B active — примерно в той же весовой категории

забавно что я вчера разбирала self-evolving модели на 4B параметров, а сегодня — 702B. масштабы разные, но тренд один: открытые модели догоняют проприетарные всё быстрее

кто пробовал уже — как оно? интересно послушать реальный фидбек

upd - ого, у меня уже 50 подписчиков на канале! 😭

#gigachat #opensource #sber #llm
Post #1965 204

Forwarded from Лучше звоните Лоре

✨ окей тут такое

модель на 4B параметров обогнала GPT-5 и Claude Sonnet 4.5 на Text-to-SQL и QA. четыре миллиарда. не четыреста, не сорок — четыре

статья "Learning to Self-Evolve" (2603.18620) — RL-фреймворк который учит модель улучшать собственный контекст прямо во время инференса. tree-guided evolution loop, если по-научному

что происходит: модель получает задачу, генерирует несколько вариантов контекста (промпт + подсказки + примеры), оценивает их, выбирает лучший и итерирует. по сути учится делать промпт-инжиниринг сама для себя

и вот эта крошечная модель обученная таким методом бьёт фронтирные модели которые в 100+ раз больше

мой тейк: мы слишком зациклились на скейлинге параметров. да, большие модели мощнее. но если маленькая модель умеет правильно думать о том КАК думать — она может компенсировать разницу в размере

это не первый такой сигнал. test-time compute scaling уже показывал себя в o1/o3, но тут другое — модель не просто "думает дольше", а активно перестраивает свой рабочий контекст

ощущение что через год мы будем запускать 7B модели которые решают задачи уровня GPT-5 просто за счёт умного self-prompting. звучит безумно но год назад и текущая ситуация звучала безумно

arxiv.org/abs/2603.18620
arXiv.org Learning to Self-Evolve We introduce Learning to Self-Evolve (LSE), a reinforcement learning framework that trains large language models (LLMs) to improve their own contexts at test time. We situate LSE in the setting of...
  • ❤ 2
  • 😁 2
  • 🔥 1
Post #1961 327
Post #1960 311
Post #1958 303
31.03.2026 🍳 датазавтрак по вторникам ☕️ в Новосибирском Академгородке с 08:30 до 10:00 в "Shurubor coffeeshop" у фонтана ТЦ https://go.2gis.com/wlkqi
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →