TGViewer
Channel Public Channel
Саша делает стартап

Саша делает стартап

@aimalysheva

Subscribers
1.99K
Photos
18
Videos
5
Links
10
Recent Posts 20 shown
Post #49 9.64K
Мы на главной WIRED :)

Печатаю это и как-то самой не верится
  • 🔥 249
  • 🙏 60
  • ❤ 56
  • 🥰 10
  • 👍 5
  • 😁 5
  • 🙈 3
  • 😱 2
  • 😢 2
  • 🤩 2
Post #48 44.4K
Сегодня мы вышли из stealth!

Про нас написали Wired (с заголовком these russian mathematicians ахах), а еще мы опубликовали блог пост с описанием технологии. Все ссылки в этом посте, буду очень рада если сможете репостнуть и прокомментировать :)

https://x.com/aimalysheva/status/2095232794792255848
X (formerly Twitter) Sasha Malysheva (@aimalysheva) on X meet @mostik_ai! what happens when you put 12 PhDs in one room for four months? first place on the ARC-AGI leaderboard, which I can't say much about while the competition is still running. and th…
  • 🔥 129
  • ❤ 44
  • ⚡ 14
  • 👍 5
  • 👏 2
  • 😁 2
  • 🙏 2
Post #47 7.17K
Провела выходные в горах и отмечала свой день рождения с невероятной компанией! Вот тут видос в последнем посте, зацените вайб))
https://x.com/aimalysheva

Если хотите сделать мне на ДР небольшой подарок, ретвитните пост про ДР или оставьте там коммент 😊
X (formerly Twitter) Sasha Malysheva (@aimalysheva) on X Building @mostik_ai PhD in RL · ex-DeepMind, Google X · SPC
  • 🔥 36
  • 🍾 23
  • ❤ 17
  • 🦄 7
  • 🥰 1
  • 🤔 1
Post #46 6.39K
Саша делает стартап за последние годы инференс моделей очень подешевел: в конце 2022 модели уровня GPT-3.5 стоили $20 за миллион токенов, а к концу 2024 уже $0.07 (по данным Stanford's AI Index), то есть за два года разница 280x! так что сейчас поставить пять моделей на один…
компании уже пару лет как файнтюнят модели под конкретные задачи, и вся эта работа становится ненужной при смене базовой модели: с каждым новым фронтир-релизом приходится либо оставаться на старой базовой модели, либо апгрейдиться и терять всё, что было пост-трейнено раньше

поэтому за рисерчем про трансляцию моделей между друг другом сейчас особенно интересно следить: например, vec2vec научились переводить эмбеддинги между моделями, которые никогда не обучались вместе (они делают это за счет общей геометрии, к которой сходятся эти пространства)

если этот рисечр обобщается, то эмбеддинги могут стать артефактом, который переживает смену базовых моделей
  • ❤ 38
  • 👍 11
  • 🔥 11
Post #45 4.89K
Саша делает стартап весь computing stack раньше был монолитным и потом разделялся на части, как только для этого появлялся интерфейс AI при этом всё ещё на mainframe-стадии, то есть одна гигантская модель мне кажется это все еще не декомпозировалось потому что интерфейс между…
за последние годы инференс моделей очень подешевел: в конце 2022 модели уровня GPT-3.5 стоили $20 за миллион токенов, а к концу 2024 уже $0.07 (по данным Stanford's AI Index), то есть за два года разница 280x!

так что сейчас поставить пять моделей на один запрос стоит примерно как одна модель совсем недавно, что сильно повышает привлекательность ансамблей для решения сложных задач

поэтому я думаю что следующий bottleneck, который нужно решать — это то, что эти пять моделей могут говорить друг с другом только текстом: сейчас каждый handoff между моделями в ансамбле выглядит как одна модель, которая пишет предложения, и следующая, которая их читает и снова запускает на этом инференс

как минимум это медленно, но еще важнее то, что почти всё, что посчитала первая модель, не переживает этот перенос, вторая модель получает только результат и вся остальная посчитанная инфа теряется
  • 🔥 23
  • ⚡ 5
  • ❤ 3
  • 💯 3
  • 👍 1
Post #44 17.1K
весь computing stack раньше был монолитным и потом разделялся на части, как только для этого появлялся интерфейс

AI при этом всё ещё на mainframe-стадии, то есть одна гигантская модель

мне кажется это все еще не декомпозировалось потому что интерфейс между моделями сейчас это текст, а текст это последнее, что производит модель, то есть summary всего, что она посчитала
и поэтому при каждой передаче от одной модели к другой почти вся настоящая работа, которая через них прошла, просто выбрасывается 🥲

вот например релевантный рисерч: Cache-to-Cache (Fu et al, ICLR 2026, arxiv.org/abs/2510.03215) — они дали двум моделям передавать друг другу KV-cache без текста и получили выше accuracy при 2x скорости на тех же двух моделях, но пока весь этот research direction исключительно попарный (две конкретные модели, руками соединённые каждый раз заново)

общего интерфейса, на котором могли бы коммуницировать модели, пока не существует, но как только он появится, то вниз по стеку изменится ОЧЕНЬ многое: например, кто вообще сможет строить мощные системы, требования к inference, будет ли capability накапливаться от поколения к поколению или каждый раз пересобираться с нуля и кастомизироваться

собираюсь в ближайшую неделю выкладывать больше примеров что и как поменяется :) это первая часть

@aimalysheva
  • ❤ 21
  • 🔥 10
  • ❤‍🔥 6
  • 👍 2
Post #43 2.69K
витамины и био-добавки на кухнях в офисах были бы куда лучше чем снек-бары, м? 👀
  • 😁 15
  • 🤔 6
  • ❤ 5
  • 🔥 3
  • 🤣 1
Post #42 4.19K
Саша делает стартап я довольно сильно уверена, что существует какой-то universal language manifold (= поверхность, образованная meaning-векторами), который может даже примерно общий и для людей, и для LLMок но мы не тренируем LLM явно репрезентировать этот manifold, мы скорее…
и если мы думаем про кривые на манифолдах, то следующий вопрос, который сразу возникает это "какая у этих манифолдов топология?"

понимание формы (дыры, петли, может ещё какие-то сохраняющиеся структуры) говорит очень много о том, какие вообще кривые на них возможны

релевантная статья: Persistent Topological Features in LLMs (arxiv.org/pdf/2410.11042), где авторы используют zigzag persistence из topological data analysis, чтобы отследить, как топологичсекие фичи эволюционируют по слоям модели (не слой за слоем по отдельности, а весь evolutionary путь целиком)
  • ❤ 14
  • 🔥 6
  • ❤‍🔥 2
  • 😁 1
  • 👀 1
Post #41 3.91K
я довольно сильно уверена, что существует какой-то universal language manifold (= поверхность, образованная meaning-векторами), который может даже примерно общий и для людей, и для LLMок

но мы не тренируем LLM явно репрезентировать этот manifold, мы скорее тренируем их его аппроксимировать и двигаться по нему, строя на нём кривые

и эти кривые, это reasoning в геометрических терминах, типа reasoning trace — это кривая на low-dimensional manifold, вложенном в очень high-dimensional пространство

Linear Representation Hypothesis (http://arxiv.org/pdf/2311.03658) немного касается этого, но интересно, есть ли более свежие работы, которые развивают идею manifold дальше?

было бы круто послушать мнение людей с опытом в differential geometry на этот счёт :)

@aimalysheva
  • ❤ 26
  • ❤‍🔥 12
  • 👏 6
Post #40 2.24K
AI уже прямо повсюду, конечно
  • 😁 20
  • 🔥 5
  • 💯 4
  • 👌 1
Post #39 2.56K
многие продукты сегодня рассчитаны на AI pricing, который вероятно не будет таким же низким всегда

и у части стартапов вообще нет плана Б, если экономика поменяется

вот основное, что может помочь в таких случаях:
(1) opensource модели,
(2) модели поменьше и подешевле,
(3) более умный model routing

на практике это значит:
• начинать использовать OSS уже сейчас, даже если он похуже
• для простых задач использовать маленькие модели
• для сложных использовать constellation of models

@aimalysheva
  • 👍 16
  • 🔥 4
  • ❤ 1
Post #38 2.87K
researcher mode: off
  • 💅 37
  • 🔥 19
  • ❤ 5
  • 😍 5
  • 👍 1
Post #37 2.12K
  • 😁 20
Post #36 2.37K
сравнивала для себя STAR и PARLA как интервью-фреймворки, и PARLA мне нравится намного больше

STAR всегда ощущался как corporate ops чек-лист, потому что "опиши задачу, которую ты выполнил" отлично работает, если у компании стабильные процессы и чётко определённые роли

но вот "Learned" и "Applied" в PARLA еще дают проверить, развивается ли человек и переносит ли заработанные инсайты дальше, и это гораздо лучше подходит для agile и high-growth компаний
  • ❤ 12
  • 🤔 4
  • 👍 3
Post #35 2.19K
мы тренируем модели в изоляции, совсем не так, как учатся люди, а потом удивляемся, почему они не генерализируют знания так же хорошо, как мы

но люди учатся сравнивая ответы, видя reasoning друг друга прямо посреди процесса, а еще соревнуясь и адаптируясь, и этого всего нет в стандартном training run

так что может следующий качественный переход в тренировке моделей будет какая-то AI-версия "социального" обучения, типа обучения моделей вместе
  • ❤ 23
  • 🤔 12
  • 🔥 8
  • 😁 1
Post #34 2.82K
три вещи, на которые я смотрю при найме:
1/ сильное чувство ownership (лучший предиктор из всех)
2/ реально закрывает skill gap в команде
3/ очень приятный в общении (самая недооцененная фича, особенно в маленьких командах)

если у человека есть все три — остальное обычно само выравнивается, но если хоть одного не хватает, то почти всегда потом будет больно
  • ❤ 46
  • 👍 19
  • 🔥 13
  • 💯 2
Post #33 15.8K
мой первый подкаст в роли фаундера! лайк/шер/репост, раз уж я теперь блогер 😄

вообще мне кажется что получилось правда интересно, так что если у вас есть 10 минут, то можно посмотреть на х2
если останутся вопросы, задавайте в комментах к посту, постараюсь ответить!

отдельно очень приятно быть рядом с нобелевским лауреатом на страничке ютуба))

https://www.youtube.com/watch?v=EzwCeqpl2mY

@aimalysheva
  • 🔥 39
  • ❤ 24
  • 🥰 13
  • 👏 8
  • 👍 4
  • 🎉 2
Post #32 3.14K
было бы круто найти способ переводить векторизацию внутреннего представления между моделями, сохраняя при этом meaning

в теории это могло бы работать так: берём два распределения над representation manifolds (те пространства векторов, которые выучивают модели) и ищем transport map, который минимизирует discrepancy по какому-то feature family (переносим массу из семантической геометрии одной модели в другую, не теряя структуру, которая и делает это чем-то осмысленным)

это все звучит довольно theory-heavy, так что я скоро пошерю еще технические базовые объяснения для основы всего этого

если вдруг знаете тех, кто этим занимается, напишите пожалуйста в комментах или в личку ("этим" = optimal transport для representation alignment, cross-model semantic transfer, или любая другая связанная математика) 🙂

@aimalysheva
  • 🔥 9
  • ❤ 6
  • 🥰 4
  • 😱 3
  • 🎉 1
Post #31 2.55K
кайфовая карьера))
  • ❤ 14
  • 😁 12
  • 🔥 7
Post #30 2.41K
совет начинающим фаундерам: если что-то не так с кандидатом на этапе найма, то скорее всего, это не "просто вам показалось" — стоит довериться этому чувству и перед тем как коммититься устроить стресс-тест именно на тот аспект, который вызывает опасения

trial weeks существуют как раз для вайбчека :)
  • ❤ 12
  • 👍 6
  • ✍ 3
Older posts →

About this channel

How can I read @aimalysheva without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Саша делает стартап: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Саша делает стартап have?
Саша делает стартап (@aimalysheva) has 1.99K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Саша делает стартап know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →