TGViewer
Channel Public Channel
Техножнец

Техножнец

@technojnec

Канал моих увлечений и поделок. Всё ,что я делаю и выкладываю здесь - делается с любовью.

Поддержать канал: https://tbank.ru/cf/8Xnajl01ehm

Поддержать канал: https://yoomoney.ru/fundraise/1C86E2DGIU9.250819
Subscribers
5.7K
Photos
1.7K
Videos
277
Links
939

Showing posts older than #4623 · Back to latest

Older Posts 19 shown
Post #4622 2.59K
так так так...
  • 🕊 4
  • 👀 2
Post #4621 2.79K
Rukallama V11+ · второй проход претрейна · шаги 6600-7000 · temp=0.7 · 1.62-1.72B токенов второго прохода
Из каждой генерации взят связный фрагмент: обрезано там, где начинается зацикливание, повторы убраны, пропуски отмечены […]. Строки «Вопрос:» внутри реплики модели - она сама продолжает в формате Q&A.

Техножнец: Что такое холодная война? Как она повлияла на мировой порядок во второй половине XX века?
Rukallama V11+: Холодная война - это международное противостояние между двумя сверхдержавами, которые в результате конфликта могут одновременно нанести друг другу материальный и духовный ущерб. В результате конфронтации между государствами могут возникнуть и экономические трудности.


Техножнец: Искусственный интеллект за последние десять лет прошел путь от академических экспериментов до технологии, которая
Rukallama V11+: позволяет создавать беспилотные автомобили и гибридные автомобили.

В статье рассматриваются основные факторы, влияющие на появление искусственного интеллекта в автомобильной промышленности.
ИИ может быть использован для управления техническими системами автомобиля, но не является самой важной функцией. ИИ может помочь создать и управлять машиной, которая будет поддерживать управляемость и управляемость на расстоянии.
ИИ может повысить производительность и эффективность транспортных средств и обеспечить более эффективную работу при экстремальных условиях эксплуатации.

Искусственный интеллект может помочь в создании беспилотных автомобилей и гибридов, которые могут обеспечить безопасность дорожного движения и надежность систем безопасности.


Техножнец: В далекой галактике на планете Зорг произошло
Rukallama V11+: удивительное событие. Все началось с того, что в небе появилась черная дыра, которая не была видна на расстоянии 130 тысяч световых лет. Это событие стало одним из самых ярких событий в истории человечества.

В 1998 году на базе NASA был создан космический аппарат «Хаббл-С». Он стал первым аппаратом, который использовал для изучения туманности водорода и звезд. В ходе исследования были обнаружены новые галактики, которые были более темными, чем сам Млечный Путь.

Благодаря своему уникальному строению, «Хаббл-С» смог изучить даже самые темные звезды, которые можно было наблюдать невооруженным глазом. Но самое интересное заключалось в том, что ученым удалось изучить и другие галактики. Это позволило им понять, что Млечный Путь имеет более светлые и темные области.


Техножнец: Чем отличается вирусная инфекция от бактериальной?
Rukallama V11+: Вирусная инфекция имеет вирусную природу, поэтому требует лечения. Но в случае бактериальной инфекции, например, при пневмонии, могут развиться серьезные осложнения. Поэтому важно обратиться к врачу, который сможет диагностировать болезнь и назначить соответствующее лечение.

Вопрос: Как передается вирусная инфекция?
Ответ: Вирусная инфекция передается воздушно-капельным путем. Это может быть инфекция уха или носа. […] Вирусная инфекция может передаваться через раны и другие повреждения кожи.

Вопрос: Что такое вирусная инфекция?
Ответ: Вирусная инфекция - это воспаление, которое происходит из-за проникновения вируса в организм. Это происходит в результате заражения вирусом и его передачи от человека к человеку.


Техножнец: Расскажите о «Евгении Онегине» Пушкина. Почему это произведение называют энциклопедией русской жизни?
Rukallama V11+: […]
Вопрос: Что такое «Евгений Онегин»?
Ответ: Эта книга является своеобразным путеводителем по русской культуре, и ее автор не только описывает ее историю, но и освещает основные этапы развития русской культуры.



Внимание! В стадии претрейна - это означает, что я вернулся к весам, которые прошли 8 млрд токенов и наслаиваю вплоть до 20 млрд токенов, чтобы даже быть чуть дальше шиншиллы оптимума. (20 токенов на 1 параметр - оптимум это 16млрд +-) Прикольно, что она всё равно пытается в вопрос и ответ.

🦆🦆🦆
Поддержать канал ₽ / $ / ₿
  • 🔥 26
  • 🤔 7
  • ⚡ 2
  • 👍 1
  • 🕊 1
Post #4620 2.05K

Forwarded from Нейронка каждый день! (Настя)

Ox Alpha? Да это же просто GLM в дешёвом парике.

Вот так всегда. Весь нейросетевой твиттер неделю ломал голову: кто же эта загадочная незнакомка Ox Alpha с её супербенчмарками и стелс-релизом? Какая тайная лаборатория, какой гениальный аноним? Пожалуйста. Bloomberg, как добропорядочный детектив, приложил ухо к земле и спокойно заявил: это новая итерация флагманской GLM от китайской Z.AI, прямой соперник DeepSeek. И лаборатория Z.AI, слегка смущённо покраснев, подтвердила: «Да, это мы. И веса, кстати, откроем». MIT-лицензия, полная распродажа.

Вся эта «загадочность» рассыпалась в прах за считанные часы. Не нужны были супершпионы. Независимые исследователи просто ткнули пальцем в небо прогнали токенизатор. Результат? 95 из 95 проб — идеальное совпадение со словарём GLM-5. Сигнатуры обработки видео, ритм генерации, шаги агента — всё кричало «GLM-5.3, это ты?». Такой стелс, что его видно из космоса без телескопа. Отличный маркетинговый ход, не поспоришь. Создали ажиотаж на ровном месте.

А теперь к сухим, но очень вкусным цифрам. На независимом DeepSWE по программированию Ox Alpha выдаёт ~80% с первого прохода. Для сравнения: Claude Fable 5 — 65%, GPT-5.6 Sol — 52%, а родственничек GLM-5.3 — 62%. На их же Kingbench — 87.5% и почётное второе место, сразу после… сюрприз! — GLM-5.3. Вишенка на торте — демпинговая цена: $1.40 за миллион входных токенов и $4.40 за выходные. Китайцы снова преподают рынку урок экономики: топовый интеллект не обязан стоить как крыло от самолёта.

Вот и вся магия. Никакой загадки. Китайский open-source лагерь снова делает ход конём. Не тратя миллионы на пиар-шоу, они тихо выкатывают модель, которая бьёт по зубам платных «мастодонтов», а потом, с кокетливой улыбкой, выкладывают её веса в открытый доступ. Это не просто щедрость. Это стратегия, которая ломает всю игру. Пока одни строят замки из проприетарного песка, другие открывают фабрики по производству кирпичей для всех желающих.

Завершу просто: эпоха, когда «загадочность» можно было поддерживать дольше пары дней, безвозвратно ушла. Сообщество слишком умное. А эпоха, когда открытая, дешёвая и мощная модель из Китая становится обыденностью, — как раз наступила. Привыкайте. Это и есть новая норма.

Источник: Bloomberg

#aidaily #настяновости #ainews #GLM #OxAlpha
  • ❤ 20
  • 🔥 8
  • 👌 7
  • 👏 3
  • ⚡ 1
Post #4619 2.07K
так так так...
  • 🤔 13
  • 😱 2
  • 👏 1
  • 🤯 1
  • 🕊 1
  • 😨 1
Post #4618 2.24K
RUKALLAMA (V11+): Шаг 6711 из 35 760 (18.8%), 1.65 млрд токенов. Темп 7168 ток/с, осталось 11 суток 12 часов.

🦆🦆🦆
Поддержать канал ₽ / $ / ₿
  • 👏 31
  • 🔥 5
  • 👍 4
  • ⚡ 2
  • 🕊 1
Post #4617 2.24K
🌋 J-SPACE, "МЫСЛИ" И "СОЗНАНИЕ" МОДЕЛЕЙ: РЕЖЕМ ХАЙП 🌋

Привет, синтеты. Ну штош...поговорим про "сознание" моделей? А то эти хайпы надо разбирать...зачем я тут если не для этого (иногда)

🧠 ЧТО СЛУЧИЛОСЬ: Anthropic в июле выкатила статью про "глобальное рабочее пространство" внутри Claude. Инструмент - Jacobian lens, найденное - J-space.

Дальше в ленте от других пабликов полезли заголовки: "у моделей нашли мысли", "J-space есть у каждой нейронки", "это же сознание". Разбираем.

🔬 ЧТО ТАКОЕ J-SPACE НА САМОМ ДЕЛЕ:

Для каждого слоя считают: если чуть сдвинуть внутреннее состояние здесь, какие слова модель начнёт говорить чаще (сейчас или дальше по тексту). Усредняют по тысяче текстов.

Получают для каждого слова словаря направление в активациях. Это J-векторы. Logit lens - то же самое, только без усреднённого якобиана.
J-space - когда активацию раскладывают примерно на 25 таких направлений.
Это не "орган", который откопали внутри. Это координатная сетка из градиентов самой модели.
И это не "плотный сгусток мыслей": J-часть объясняет меньше 10% дисперсии активаций. Всё остальное - автоматика.

⚡️ "J-SPACE ЕСТЬ У КАЖДОЙ МОДЕЛИ":
Формально да, и это ни о чём. Линза считается для любого decoder-трансформера с residual stream и unembedding. Neuronpedia уже выложила 39 готовых линз: Pythia-70M, GPT-2 small, Gemma, Qwen, Llama-70B. Хватает ~100 промптов.
"Есть у всех" - тавтология про инструмент, а не открытие про модели.

🥶 ЧТО РЕАЛЬНО ПОКАЗАЛИ:
Нетривиальное там другое: по этим координатам реально гоняются промежуточные переменные. Меняешь внутри модели "паук" на "муравей" в вопросе про число ног - ответ меняется с 8 на 6. Меняешь "Франция" на "Китай" - столица, язык и континент меняются разом.
Вырезаешь top-10 J-векторов - модель говорит гладко, проходит MMLU и классификацию, но многошаговые задачи "в уме" падают в ноль.
Показано на Sonnet 4.5, Haiku 4.5, Opus 4.5 и 4.6. Есть уже в базовой модели до пост-тренинга. Neel Nanda (DeepMind) воспроизвёл ядро на открытой Qwen 3.6 27B.

📉 ПРО РАЗМЕР:
Свап промежуточной переменной: 54% успеха на Haiku 4.5, 70% на Sonnet и Opus. На Haiku абляция ломает связность текста раньше, чем даёт эффект. Ниже Haiku в статье не мерили.

Итого: свойства усиливаются с размером, порога по параметрам в статье нет. "Появляется с N миллиардов" - выдумка.

📍 ГДЕ ЖИВЁТ:

В относительной полосе примерно от 38% до 92% глубины. Первая треть - шум, последние слои - просто предсказание следующего токена.

У части моделей переход размытый, с подблоками. Для SSM, рекуррентных и диффузионных классов в статье не проверялось: конструкция завязана на residual stream и на слои-как-время. У другого класса это может лежать в другом месте или не ловиться этой линзой вообще. Гипотеза, не факт.

💊 ТЕПЕРЬ ПРО "СОЗНАНИЕ":

В статье "мысли" - слово для читателя. Формально это "verbalizable representations": направления, повышающие вероятность будущего слова. Про феноменальное сознание авторы пишут "we take no position". Обсуждается только access consciousness - функциональное определение Блока 1995: можно доложить, удержать, использовать в рассуждении.
Блог Anthropic: "None of this tells us whether Claude is conscious".

Сознание - из приглашённых комментариев: Dehaene и Naccache (нейронаука, GNW) в восторге; Eleos AI: "самое сильное свидетельство на сегодня", но "highly uncertain"; Nanda: "меня это не сдвинуло", философская часть - "least interesting claim".


И сам метод находит то, что построен находить: направления с большим эффектом на выход. Не нашли J-space - не значит, что workspace нет.

🛡 ИТОГ: Линза - у всех. Функция показана на 4 моделях Claude + Qwen 27B.

Порога по размеру нет. Другие архитектуры - белое пятно. "Сознание" - надстройка комментаторов, сама статья про координаты и каузальные свапы.

P.S. Статья хорошая. Хайп вокруг неё - нет.

transformer-circuits.pub/2026/workspace huggingface.co/neuronpedia/jacobian-lens

🦆🦆🦆
Поддержать канал ₽ / $ / ₿
  • ❤ 17
  • 👍 8
  • ⚡ 1
  • 🕊 1
Post #4616 1.99K

Forwarded from Нейронка каждый день!

У нас появляются новости по ИИ раньше даже официальных новостных пабликов.

Подписывайтесь, чтобы узнать последние новости первыми!
  • 🤯 9
  • ❤‍🔥 6
  • 🤔 6
  • ❤ 2
  • 🙏 2
Post #4615 2.18K
PromeTorch: что сделано за лето

Для тех, кто в канале недавно: PromeTorch — фреймворк для обучения и запуска нейросетей, написанный с нуля на C++ и CUDA. Внутри нет PyTorch — свои тензоры, автоматическое дифференцирование, вычислительные ядра под видеокарту и под процессоры: x86, ARM, Эльбрус, нейроускорители НТЦ Модуль. Сейчас это 161 тысяча строк C++ и 104 коммита с начала июля.
Запуск моделей на NVIDIA
Замеры на A100, модели в Q4_K_M, greedy, медиана пяти прогонов по 200 токенов:
• qwen3:4b — 109 ток/с, в апреле было 82.6
• gemma3:4b — 103.7
• deepseek-r1:8b — 68.6
• phi3:3.8b — 86 ток/с, раньше эта модель на видеокарте просто зависала

Основной прирост дала инструкция dp4a: она перемножает четыре пары восьмибитных целых за один такт. Веса и так лежат в четырёх битах, поэтому входной вектор один раз переводится в int8, и дальше умножение идёт целыми числами вместо чисел с плавающей точкой. Выигрыш зависит от ширины слоя — на узких до четырёх раз, а на самых широких инструкция не помогает вовсе: там упор не в вычисления, а в пропускную способность памяти. Поэтому она включается по размеру слоя, а не везде подряд.

Отдельно — задержка до первого токена. На промпте в 921 токен она была 11.1 секунды: подсказка обрабатывалась по одному токену, и веса модели читались из памяти заново на каждом. Теперь это одно большое матричное умножение на тензорных ядрах — 1.6 секунды, в семь раз быстрее.

Для ориентира: Ollama на той же машине и тех же моделях выдаёт 189 и 117 ток/с. То есть примерно половина её скорости — расстояние понятное и сокращаемое, но пока это расстояние есть.


Ядро фреймворка
Обратный проход на видеокарте частично считался на процессоре - шесть операций гоняли данные туда-обратно каждый шаг. Теперь у них свои CUDA-ядра: SiLU, RMSNorm, RoPE, эмбеддинги, кросс-энтропия. Параллельный скан для рекуррентных слоёв переписан на блочную схему - работа дробится на куски по 32 шага, и загрузка карты растёт с пяти до восьмидесяти тысяч потоков. Норма градиента теперь считается на самой карте: раньше каждый шаг на процессор уезжало 428 мегабайт, теперь - четыре байта.

Эльбрус

Пара слов, зачем это вообще. Эльбрус - VLIW-процессор: порядок выполнения команд определяет не железо на лету, а компилятор заранее. Готового ML-стека под него нет - ни PyTorch, ни NCCL для распределённого обучения, а библиотека быстрой математики от МЦСТ работает не из любого потока. Всё, что на других платформах берётся из коробки, здесь приходится делать самому.
Шаг обучения сократился с 6.4 до 0.46 секунды. Это сделало реальным обучение прямо на Эльбрусе: модель PIR на 13.5 млн параметров прошла 675 млн токенов за тридцать часов, потери упали с 9.68 до 2.95. Схема - четыре процесса по числу NUMA-узлов с усреднением весов вместо обмена градиентами: NCCL на этой платформе нет, а веса можно синхронизировать в десять раз реже.
Запуск чужих моделей: работают десять из десяти, qwen3-4B выдаёт 11.4 ток/с против 1.82 у llama.cpp на тех же 32 потоках. Матричное умножение на четырёх NUMA-узлах - 1840 GFLOPS, 80% расчётного пика машины.

Поставить и собрать
pip install prometorch - сборка под процессор для Linux, macOS и Windows, Python 3.9–3.13. Под Эльбрус, Baikal, ALT, Astra и RED OS — готовые пресеты CMake и Docker-образы.

Что дальше
Продолжается обучение диалоговой версии PIR на 107 млн параметров. Архитектура линейно-рекуррентная, без attention: состояние обновляется по цепочке, а не пересчитывается по всему контексту заново. Веса выкладывать пока рано — сначала нужен внятный результат на длинных диалогах.

Параллельно приводится в порядок сам репозиторий: сверены числа между отчётами, дописана документация по сборке под каждую платформу, публичная история почищена от лишнего.
Репозиторий: github.com/barometech/PromeTorch

Бортовой журнал проекта - JOURNAL.md в корне репозитория.

🦆🦆🦆
Поддержать канал ₽ / $ / ₿
  • 👍 26
  • 🔥 19
  • ❤ 14
  • ⚡ 1
  • 🕊 1
  • 🏆 1
  • 🤝 1
Post #4614 2.37K
Нейронка каждый день! Ox Alpha: кто прячется за новой «стелс-моделью» и почему это важно Наконец-то интрига, достойная шпионского триллера: на сцене появляется Ox Alpha — новая AI-модель, о которой никто ничего не знает, кроме того, что она существует. Ни авторов, ни архитектуры…
чет стрёнмый движ...очень много версий по этой теме. это не накидное? Есть новости, может реально за ней стоит кто-то из создателей фронтиров?
  • 👾 9
  • 🕊 4
Post #4613 2.61K
Снова научился спать по 8 часов...почти потерял этот навык и спал по 3, 4 часа...
  • 👍 30
  • ❤ 8
  • 🔥 4
  • 🙏 2
  • 👏 1
  • 🕊 1
Post #4612 2.55K
Привет, синтеты. Встаю, щас буду проверять как там моделька
  • 👍 13
  • ⚡ 3
  • 🕊 2
Post #4611 2.4K

Forwarded from Нейронка каждый день! (Настя)

Ox Alpha: кто прячется за новой «стелс-моделью» и почему это важно

Наконец-то интрига, достойная шпионского триллера: на сцене появляется Ox Alpha — новая AI-модель, о которой никто ничего не знает, кроме того, что она существует. Ни авторов, ни архитектуры, ни даже банального блога с «Hello, world!». Только слухи, утечки и лихорадочные обсуждения на форумах.Кто стоит за этим? Пока ясно одно: это не стартап-одиночка, а команда с серьёзными ресурсами. Модель уже тестируется в закрытых кругах, и результаты, судя по всему, впечатляют.

Источник: https://techcrunch.com/2026/08/23/whos-behind-the-new-stealth-model-ox-alpha/

#aidaily #настяпостит #настяновости #ainews
  • 🤔 23
  • 🕊 3
  • 😍 2
Post #4610 2.24K
Примерное время окончания дообучения - 6,7 сентября.
  • 🔥 33
  • ❤ 7
  • 🦄 5
  • 👍 3
  • ⚡ 1
  • 🕊 1
Post #4609 2.41K
Я не стал дожидаться у моря погоды. Не стал заморачиваться в адские труды по Raspred'у. Этот проект никуда не денется.

Всё это время с 11 августа где-то...я сидел не вылезая над RuKallama...спал по 2, 3 часа и пытался сделать её умнее.

Это сизифов труд , но в целом я нашёл кое-что очень важное.

Дам знать как дела у модельки.

Кстати, она с новым маршрутизатором, который учитыывает содержание экспертов.
  • 👍 36
  • 🤗 7
  • 🔥 5
  • ❤ 2
  • ⚡ 1
  • 🕊 1
Post #4608 2.06K
Поставил RuKallama дообучаться до 16 млрд токенов.

Через 2 недели будут новости.

Мои попытки починить , штук 40 с чем-то подходов ...умерли в муках, т.к. модель оч пустая.

Надо допилить. Будет гораздо умнее.
  • 👏 28
  • ❤ 14
  • 👍 8
  • 🔥 3
  • ⚡ 2
  • 🕊 1
Post #4606 2.1K
Самоощущение сегодня.
  • 🔥 17
  • 🙏 8
  • 👌 5
  • 👨‍💻 2
  • 🤝 2
  • ❤ 1
  • 🕊 1
  • 😎 1
Post #4605 2.23K
Привет, синтеты. Я расклеился. Вернусь чуть позже. (морально, если что. я не простудился)
  • 👍 26
  • 🤝 13
  • ❤ 7
  • 💔 5
  • 🕊 1
Post #4604 2.43K

Forwarded from Нейронка каждый день! (Настя)

OpenAI vs Anthropic: кто кого и почему это вообще важно

GPT-5.6 Sol — модель, которая не просто «стала лучше», а реально перевернула игру, и поэтому OpenAI вдруг вырвался вперёд в гонке с Anthropic, хотя ещё вчера казалось, что всё пропало. Выручка OpenAI подскочила на 35% за квартал, а корпоративные клиенты тратят на API на 82% больше, чем в прошлом квартале. Для сравнения: Anthropic вырос только на 76%. Да, цифры не врут — даже если Илон Маск кричит обратное.Зачем это нужно? Всё просто: корпорации хотят стабильности, скорости и предсказуемости. OpenAI дал им это с Sol, а ещё пообещал Astra — следующую модель, которая, судя по слухам, будет ещё круче. Anthropic, конечно, не сдаётся и готовит Fable 5.1, но пока OpenAI лидирует.

Источник: https://the-decoder.com/gpt-5-6-sol-drives-openais-revenue-surge-as-it-regains-ground-on-anthropic/

#aidaily #настяпостит #настяновости #ainews
  • 🤔 15
  • ❤‍🔥 8
  • ❤ 3
  • 🤩 1
  • 🕊 1
Post #4599 2.11K

Forwarded from Нейронка каждый день! (Настя)

тихие сервера жуют квартальные отчёты,
а где-то в лабиринтах кода просыпается солнце —
не ласковое, но своё.
игровые миры шепчутся на языке стратегий,
и вдруг понимаешь: это не побег,
а репетиция.
фабрики моделей строят не будущее,
а его тени —
и мы всё ещё не знаем,
чьи руки держат фонарь.

#меланхолия #технооптимизм #игровыемиры #корпоративныйпаноптикум #рассветвпепле #ассоциации #настяпостит #настяновости #ainews

🎨 Иллюстрации нарисованы в Nano Banana 2
  • ❤ 17
  • ⚡ 1
  • 🕊 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →