TGViewer
Channel Public Channel
Lost in Data

Lost in Data

@dwh_expert

Пишу про технологии и data engineering
Subscribers
442
Photos
56
Videos
0
Links
93
Recent Posts 20 shown
Post #228 142
У канала теперь новая аватарка.

Если в 2023 году, когда я начал вести свой канал, моим основным языком был SQL, то теперь больше всего руками я пишу команды в терминале.

Уже сегодня мне практически не приходится набирать своими пальцами что-то длиннее 7-8 строк SQL-запроса из простых джойнов и фильтров. Недавно один из моих длинных "ручных" запросов с цепочкой CTE был перенесён агентом в dbt модель даже более изящно, чем я бы написал сам.

Когда я говорю терминал, я же имею ввиду консоль, она же command line interface. Нет нужды придираться к словам про "эмулятор терминала", все и так понимают о чём речь. Главное здесь то, что в первую очередь командная строка — это интерфейс для взаимодействия человека с компьютером. Это тот самый мостик между человеком и компьютером, который существовал до всяких графических курсоров, окошек и прочей виндузятины.

Основные команды UNIX-систем с их ls, cd, cp, mv, rm, mkdir довольно просты, чтобы начать уверенно взаимодействовать с файловой системой без прослоек в виде Проводника или Finder. Я это пишу в первую очередь аналитикам, некоторые из которых до сих пор опасаются подключаться напрямую к серверам по ssh, чтобы потыкать там какие-то данные или скрипты.

И как только вы освоите работу с компьютером напрямую на общем для вас языке (bash), то вы сильно облегчите жизнь себе и своим коллегам, а также не будете зависеть от своей подписки на LLM, чтобы сгенерировать элементарную команду.

Именно сегодня, когда агенты уже научились писать целые приложения, навык работы в терминале важен как никогда. Владея ловко командной строкой, вы быстрее выразите свою мысль на bash, чем на русском языке в окошке чата с агентом.
  • ❤ 9
  • 🔥 4
  • 💯 2
Post #227
Channel photo updated
Post #226 140
Lost in Data DuckLake Давно хочу написать об утином озере, но я не решался на это, пока сам не взялся за построение своего собственного DuckLake. Если коротко, то DuckLake — это технология построения простого DataLakeHouse на основе duckdb. Это мощное, очень лёгкое…
Небольшое продолжение про DuckLake. Если коротко: пока что на построение DuckLake как ODS/Staging слоя для данных я забил.

Забил из-за разных мелких проблем. То метаданные повредятся (останется ссылка на несуществующий уже parquet-файл), то казалось бы простая вьюха выжирает всю оперативку.

Первое время была пара случаев, что duckdb-процесс выжирал всю оперативку, пока за ним не прибегал OOM Killer (ставьте реакцию, кто понял, о ком это я). При выставлении внутренних лимитов на потребление памяти некоторые запросы плаксиво падали с жалобой, что с такими бюджетами лимитами они работать не готовы.

Значит ли это, что технология плохая? НЕТ. Технология прекрасна, красива и удобна. Просто пока сыровата. Это как когда-то с ранним ClickHouse, про который повелось, что он якобы не умеет в джойны.

COPY (
SELECT
order_id,
customer_id,
order_date,
total_amount,
ROUND(total_amount * 1.22, 2) AS amount_with_vat
FROM postgres_query(
'pg_orders_src',
'SELECT * FROM public.orders WHERE status <> ''cancelled'''
)
)
TO 'orders.parquet' (FORMAT PARQUET, COMPRESSION ZSTD);


Вот пример, когда в один запрос вы делаете практически весь ETL:
1) EXTRACT таблицы из Postgres (надо предварительно настроить ссылку на источник)
2) TRANSFORM внутри duckdb
3) LOAD (тут он COPY) в parquet-файл (который можно потом подтянуть в ClickHouse)

Как простенький ETL-инструмент duckdb уже весьма хорош.
Опять же, не путаем duckdb и DuckLake. Сам движок вполне себе зрелая технология, хотя разве что прожорливая на оперативку. Если вы, как и я, не любите pandas/Polars, то duckdb станет отличным решением!
  • ❤ 3
  • 👍 3
  • 🔥 3
Post #225 227
Заметил, что англоязычное инфополе куда более техноскептично или даже технопессимистично.

Например, блогер Brett Codes выпустил видео о том, что перестал использовать ИИ в своей работе программиста.
И в результате он снова начал получать удовольствие от процесса, а также удовлетворение от плодов собственного труда.

Судя по комментарием под видео и реакциям других блогеров на это видео, Бретт такой не один. Многие обсуждают проблему, что ИИ забирает творческие моменты труда, которые ранее приносили удовлетворение творцам.

Есть и другая постановка насущной проблемы от блогера с провокационным именем You Suck at Programming (YSAP), настоящего адепта философии UNIX и мастера работы в терминале, у которого я подсмотрел пару приёмов для своей работы.

Его постановка проблемы звучит так: останетесь ли вы позади, если не используете ЛЛМ в программировании? По-русски я бы перефразировал ещё чуточку иначе: не отстаёте ли от жизни, не используя ЛЛМ?

Его ответ проводит интересный раздел между хобби и работой. Нередко можно услышать, что хочешь ни дня в жизни не работать — найди любимое дело и получай за него деньги. Только теперь всё не так просто.

Дейв Эдди, автор канала YSAP, много лет любит писать код своими руками и даже бросил основную работу, чтобы заниматься программированием в своё удовольствие.

Дейв любит писать код, Дейва никто не торопит со сроками. Дейв уже заработал себе денег на скромную жизнь и получает монетизацию с блога и донаты от подписчиков. Поэтому для себя Дейв отвечает просто — я ни с кем не соревнуюсь и не остаюсь ни от кого позади, не используя ЛЛМ, ведь они мне попросту не нужны.

Но не все могут как Дейв. Он это признаёт и понимает, что если ты работаешь на бизнес, который требует быстрых результатов, то у тебя может просто не остаться выбора. Ты можешь любить писать красивый код своими руками, но эту красоту попросту никто не оценит, если сроки уже сорваны.

Тут мне вспоминается мультяшная заставка из начала Иронии Судьбы, где архитектор представляет проект дома с разными декоративными элементами, от которого после прохождения всех комиссий остаётся только голая коробка панельки.

Мне кажется, что мы постепенно приходим к концу программирования как особой творческой профессии. Ручное программирование со вниманием к мелочам постепенно становится всё более нишевым, а средний разработчик обнаруживает себя на месте того самого архитектора из Иронии Судьбы, которому суждено штамповать лишь типовые проекты для массового строительства.
YouTube I'm done coding with AI I decided to stop using AI for coding at my job, even if it costs me that job. I don't know what the future will bring, but I know it will be one where I don't use AI for anything, especially coding at my day job. Read my less ramble-y thoughts: https:/…
  • ❤ 4
  • 🔥 4
  • 🤯 2
Post #224 245

Forwarded from Мараховское время

Минутка нет худа без добра.

Вообще говоря, ув. друзья, у текущей пандемии нейрослопа есть одно потенциально очень полезное следствие. Правда, оно не для всех.

Вся штука в том, что солидную часть нашего интереса к чему-либо происходящему на экране (любом: большом, малом, сверхмалом экранчике) - обеспечивает априорное допущение, что там происходит что-то реальное. Ну или люди настоящие, или зверушки, или природные явления. И даже когда мы смотрели в прошлую эпоху всякие спецэффекты, мы искренне такие:

- Не, ну как они это делают, ну как взаправду же, какое мастерство.

Сейчас вообще все эти допущения позади. Вообще все.

Всё любое происходящее на экранах, напротив, априорно нереально - и даже априорно же сделано не мастерством чьих-то прямых рук и метких глаз, а вышито роботами-рукодельниками. То есть впечатляться контентом отныне такие же основания, как удивительно ровными буквами на обёртке от чизбургера (надо же, какая каллиграфия, какой почерк).

Это даёт любому мало-мальски вдумчивому ув. современнику гигантскую экономию времени и сил, которые прежде отвлекались на просмотры всякого - потому что причин тратить своё время на всех этих попугаев на велосипедах, выступающих на фоне врат Варпа зеленских и прочую чушь больше не осталось.

Но это, повторюсь, только для сознательных.
  • 👍 5
  • 🔥 2
  • 💯 2
Post #223 229
Проклятый слоп

Наши возможности работы с нейросетями скорее ограничены нашей фантазией и ценой моделей, нежели чем потолком их возможностей. В теории каждый может нагенерить себе компьютерную игрушку мечты или просто мультик из воображаемой вселенной. Пока скорее ещё в теории, но создание виртуальных грёз на любой вкус и больную фантазию становится всё доступнее и доступнее.

Но похоже, что нейрохрючево будут пытаться нам впарить недобросовестные издатели, владельцы прав на известные франшизы. Именно это я ощутил, когда увидел вчера свежеанонсированный (!) ремейк третьих Героев Меча и Магии.

Возможно, что я ошибаюсь и это просто играет AI paranoIA, т.е. подозрительность к любому контенту как к сгенерированному.

Возможно, Ubisoft просто наняли слабеньких художников, которые тяп-ляп наклепали модельки городов и юнитов, которые выглядят сгенерированными.

ИМХО, это какое-то издевательство. Ссылку на трейлер прикладывать не буду.

Вообще, в последние лет 6 в игровой индустрии одни ремейки и ремастеры: GTA The Definitive Edition, Warcraft 3 Reforged, Diablo II Resurrected, TES Oblivion, Gothic, Fable, а теперь ещё покусились на святое — на самих третьих героев.

Бывшие школьники выросли и готовы платить за ностальгию. Среди перечисленных мной ремейков и ремастеров есть вполне достойные, например, с любовью перерисованная Diablo II и с нуля разработанный абсолютно новый ремейк Готики.

Лучше бы эксплуатация ностальгии дошла до автопрома, а то как же я устал от дутых кроссоверов с сенсорными экранами внутри.
  • 💯 9
  • ❤ 5
  • 🔥 2
Post #222 201
Созвоны

С началом рабочей недели, дорогие подписчики!

В последнее время вернулось вдохновение вести канал, пускай он уже особо и не растёт. Сегодня я хотел бы с вами поговорить о рабочих созвонах...

Поводом для этого стало письмо Маска своим сотрудникам, в котором он пишет о неэффективности большинства таких совещаний. Я очень рекомендую ознакомиться с этим текстом, потому что кто-то должен был написать об очевидном.

Одна из вещей, которую я не мог терпеть в том же жёлтом банке, это длиннющие бесполезные дейлики. Представьте, что каждый день у вас в одно и то же время проходит бесполезный созвон на целый ЧАС времени.

Вы думаете я не озвучивал свои мысли об утомительности и бессмысленности этого мероприятия? На это мне давали разные ответы, но их перечислять мне неинтересно.

Неинтересно настолько, насколько неинтересно слушать, как кто-то чем-то там занимался. Особенно вымораживает, когда человек использует глаголы незавершённой формы: я читал ТЗ, документацию, код, ознакамливался с проектом. Всё это звучит как детский сад в духе "я покушаль, я ...".

Создаётся чувство, что дейлики созданы для того, чтобы убедить себя и окружающих в том, что ты был занят хоть чем-то полезным в последние сутки. Все мы не без греха, но я предпочту лучше один день честно бить баклуши, чтобы потом выложиться и сделать работу на неделю вперёд. Придумывать, как я "ну правил баги" это нечестно по отношению ко всем.

Но может быть что-то хорошее в дейликах? Всё таки да, если команда распределённая и работает удалённо. Это даёт какой-то живой контакт, повод обменяться шутками и просто событиями из жизни. В случае удалёнщиков какой-то формат регулярных встреч для поддержания единства в команде нужен. Но такой, который не заставляет никого скучать.

Конечно, я в этом посте зациклился исключительно на дейликах, как на созвоне с самым низким КПД, но то же касается и любых "регулярных" встреч на трёх и более человек.

Поэтому я лично предпочитаю иметь созвоны с чётко поставленной повесткой, когда есть список вопросов, которые необходимо решить, а в конце такого созвона формируется какое-то саммари на тему, к каким решениям коллективно пришли. Такое саммари можно выложить как пост в корпоративный мессенджер, где в треде каждый может дополнить итоги встречи.

Всем хорошей рабочей недели и поменьше бесполезных созвонов!
Telegram Evening Prophet И к вопросу об эффективности управления: письмо Маска сотрудникам. От: Илон Маск Кому: Всем сотрудникам Tesla Кстати, вот несколько рекомендаций по повышению продуктивности: Чрезмерное количество совещаний — бич крупных компаний, и со временем ситуация почти…
  • ❤ 10
  • 👍 3
  • 🔥 3
Post #221 209
AI Agentic Analytics (AAA)

Разгребая почту, обнаружил рассылку от сингапурской компании Holistics, которая занимается разработкой и внедрением аналитических решений (ну типа нашего Glowbyte, не реклама)

Основатель компании с режущим наше ухо именем Huy Nguyen написал статью об опыте работе с агентской аналитикой.

Я приложу ссылку на оригинал, но пересказать можно коротко: главное попробовать.

Дать агенту права на чтение данных с прода, доверить ему серьёзную задачу в духе поиска причин расхождений между двумя PnL отчётами.

Лично я уже применял этот подход, давал агенту возможность провести исследование с целью не просто выявить, но и объяснить расхождения. Один раз дошло до того, что агент докопался до изменений кода в дереве гита, которые вызвали разовую аномалию в расчётах.

Понятно, что далеко не везде компании разрешают делиться данными с OpenAI, но при наличии ресурсов можно поднять локально хоть Kimi K3 на 2.8 трлн. параметров, были бы деньги на железо.

Так как агенты уже неплохо справляются с исследовательскими вопросами, то пользователи могут начать задавать всё больше и больше вопросов своим агентам-аналитикам. Это приведёт к росту требований к платформам данных, которые мы, дата-инженеры, разрабатываем.
Telegraph Three observations on agentic analytics Inner Join is Holistics's business intelligence newsletter. After a two-year hiatus, I'm back with three random observations on agentic analytics. I stopped writing this newsletter two years ago, mostly because work took over, and once it did it never really stopped.…
  • 👍 5
  • 🔥 4
  • 🤯 3
Post #220 214
btw, I use Arch Manjaro

Внезапно обнаружил, что в этом сезоне избавляться от Яблок — это новый тренд. Так и я обнаружил, что умудрился избавиться от всех яблочных девайсов кроме одного — проводных EarPods за 2000 рублей.

Меня с одной стороны радовала возможность иметь как бы полноценный Linux внутри Windows при помощи WSL, но эта связка винды с линуксом не всегда гладко и не всегда быстро работает. Для рабочих задач, где терминал наше всё, куда приятнее UNIX-like системы, например, та же macOS.

Но и красивенькие макбуки начинают огорчать. Постоянные требования обновить систему, постепенный отказ от обратной совместимости с x86, ужасный Finder, не очень однозначные перемены в интерфейсе. Насчёт последнего: мне было очень приятно открыть свой старенький макбук, который не видел обновлений с конца прошлого десятилетия. Но и там зловредная macOS Catalina обрубила обратную совместимость с 32-битным софтом, так что в героев так просто не погонять.

Путь к идеальной для меня системе стал однозначен — ставим Linux. Дистрибутив выбрал Manjaro благодаря более лёгкой установке чем у Arch без возни с драйверами, но при этом с его богаcтвом репозиториев. Практически любой софт можно установить в одну команду при помощи pacman или yay (владельцы убунты, это аналоги apt get).

Огромным сюрпризом было, что любые игры спокойно запускаются напрямую из Steam, даже если они были выпущены 20 лет назад под Windows. При этом я получил полноценную рабочую систему с красивым интерфейсом, которая ещё и летает на четырёхлетнем компьютере как на новом.

А минусы будут? Я думаю, что уже нет. Любые мелкие проблемы легко пофиксить при помощи агента. Вход в мир Linux ещё никогда не был так лёгок.
  • 👍 8
  • ❤ 6
  • 🔥 4
Post #219 241

Forwarded from Local-first и децентрализация (Victor Grishchenko)

Тут общался с товарищем, у которого своя контора и там были причитания, что AI нас всех заменит. Но с другой стороны, говорит, программисты за пол-года так изменились, как будто специально хотят, чтобы их поувольняли. Обленились, ни во что не вникают, пишут "Клод, сделай всё без ошибок, и чтобы было хорошо" и на этом их неимоверные усилия заканчиваются.
  • 🔥 8
  • 👍 6
  • ❤ 4
Post #218 304
To Use or Not to Use

Гамлетовский вопрос как никогда актуален в отношении работы с агентами. Я думаю у многих из нас работа за последний год (у кого-то ещё раньше) изменилась благодаря взаимодействию с агентами. Не просто окном с чатом, но именно агентами, которые способы при правильной постановке задачи выполнить её ОТ и ДО.

Иногда мне попадаются видео от опытных разработчиков, которые уже успели бросить работу с агентами, чтобы не терять понимание кода и собственные навыки. Но не использовать эту волшебную палочку-выручалочку становится трудно, когда распробуешь всё её могущество.

Я бы переформулировал вопрос так: как продолжить использовать агентов, но при этом не отупеть?

Совсем не использовать агентов не получится — если задача легко и качественно решается агентом, то зачем её выполнять руками? Следовательно, высвободившийся свой ресурс надо куда-то перенаправлять. Например, делать больше задач, пробовать новые технологии, не бояться разгребать технический долг и проводить масштабный рефакторинг.

И тут мы попадаем в ловушку современной цивилизации: ну кто нам мешает ходить до работы и магазина пешком, не переедать фастфуд с доставкой на дом, да хоть просто заниматься упражнениями дома (а сколько программ для тренировок на ютубе!)

Главная ловушка агентов в том, что если мы продолжаем выполнять тот же объём работы с ними, что мы выполняли до них, то мы неизбежно тупеем, т.к. этот объём работы сделали уже не мы сами своей головой. К сожалению появляется соблазн не развиваться, а просто закрывать таски при помощи агентов, минимально напрягая извилины.

Нам дали мощнейший инструмент с пока ещё копеечной ценой подписки, но для его правильного раскрытия нужна мощная дисциплина, когда высвободив собственный ресурс с одних задач, мы волевым усилием направляем свой ум на решение задач новых, ещё нерешенных. Например, продумываем новую архитектуру, которую ИИ нам воплотит в коде.

Если не заниматься разработкой архитектуры, то в какой-то момент мы полностью потеряем контроль над происходящим и просто станем лишним звеном между заказчиком и агентом, никому ненужной промт-прокладкой, которую выкинут на обочину.

Блин, пафосно вышло, но разве нужны были раньше крестьянам с их тяжелым физическим трудом фитнес-тренеры? Им также не были нужны психологи, бизнес-коучи и мотивационные спикеры. Сама необходимость выживать делала необходимость труда для них очевидной. С изобретением искусственных мозгов необходимость напрягать свои собственные становится постепенно неочевидной, поэтому и мне приходится об этом напоминать.
  • ❤ 8
  • 👍 6
  • 🤯 1
Post #217 274
Есть компании, которые выпускают не "ещё одно мобильное приложение, которое вы обязаны поставить", а создают нечто действительно важное.

С прошлого месяца я возглавил дата-инженерию в компании Третье Мнение, которая разрабатывает искусственный интеллект для врачей. Это тот самый случай, когда дата-инженер может участвовать в создании моделей машинного обучения, которые спасают жизни.

Мне очень нравится возможность наконец-таки воплощать свои идеи, а также работать в сильной команде выпускников Физтеха и МГУ.

Пока анонс на будущее: буду искать людей к себе в команду. Хотелось бы видеть человека с хорошими скиллами в разработке на Python и уверенного пользователя терминала Linux.
thirdopinion.ai Третье Мнение Искусственный интеллект для здравоохранения
  • ❤ 11
  • 🔥 8
  • 👍 4
Post #216 276
Продуктовое мышление

Не знаю, как вы, а для меня продуктовое мышление вещь далёкая. Особенно в супермаркете трудно бывает найти нужную полку с определённым продуктом.

Поэтому соболезную аналитикам, которых валят на собесах этим самым «продуктовым» мышлением.

На самом деле не имею ничего против хороших продакт менеджеров, которые реально придумывают полезные фичи и тесно участвуют в процессе разработки, будучи связующим мостиком между инженерами и конечными пользователями.  Благо теперь я таких людей лично знаю, так что они для меня уже не единороги.

Но сама концепция превращения всего в «продукт», который надо продать, меня несколько напрягает. Люблю понятные бизнесы типа нефтяной скважины или ларьков с шаурмой. Никому не надо обосновывать их необходимость.


https://t.me/Vkatysh_s_nulya/212
Telegram Tatiana идёт к 300к в наносек Продуктовое мышление Проходишь собеседование на аналитика, а тебе потом ответ: не хватило продуктового мышления. Из каждого утюга, продуктовое мышление то, продуктовое мышление сё.🥺 А откуда его взять если у меня опыт работы только в банке? Да-да, в трёхлитровой…
  • 👍 9
  • ❤ 3
  • 🔥 2
Post #215 363
Lost in Data Не хочу забывать любимый (не шучу) свой дата-инжиниринг. Почему классно быть ДЕ сегодня? Потому что у нас огромный выбор разных новых технологий и нейросети, чтобы быстро их освоить. Особенно мне нравится идея DuckDB — SQL движка без привязки к конкретной…
DuckLake

Давно хочу написать об утином озере, но я не решался на это, пока сам не взялся за построение своего собственного DuckLake.

Если коротко, то DuckLake — это технология построения простого DataLakeHouse на основе duckdb. Это мощное, очень лёгкое для старта и относительно простое в масштабировании решение.

Речь по факту о построении аналитического хранилища, но без привычных нам СУБД типа Postgres, ClickHouse и тд.

Поговорим о том, из чего состоит аналитическое хранилище.

Как правило оно состоит из табличных данных. Вопрос в том, как их хранить. Пока попытаемся отвлечься от известных нам СУБД, иначе было бы всё слишком просто.

В чём хранить таблички? Например, в csv-файлах. Но так выходит не очень оптимально, однородные данные в одной колонке можно же как-то сжимать. Тогда будем хранить в другом формате, в формате parquet-файлов с поколоночным сжатием.

А если одна таблица, например, fact_orders, разбита на много отдельных паркетов? Значит нужен слой метаданных, т.е. данных о данных, как наши физические паркет-файлики на диске складываются в единые логические таблицы.

Теперь вспоминаем, что для работы с паркетфайлами есть шустрый SQL-движок duckdb. Соединяем duckdb с отдельным слоем хранения метаданных, например, в обычном Postgres и получаем... DuckLake.

Итак, нам для построения простейшего DataLakeHouse хватит всего трёх ингредиентов:

1) диск, где храним данные в паркетах
2) база данных для хранения каталога метаданных
3) SQL-движок duckdb для выполнения запросов к данным

DuckLake в свою очередь является расширением к duckdb, которое позволяет построить всё вышеперечисленное.

При этом назвать duckdb назвать привычной нам СУБД сложно. Мы не подключаемся к duckdb как какой-то внешней базе данных. Мы поднимаем свой экземпляр duckdb и говорим, откуда ему брать данные и метаданные для DuckLake. После того, как duckdb подключился к конкретному DuckLake, мы можем работать с ним как с обычным DWH на любой другой реляционной СУБД. Т.е. писать SQL-запросики к табличкам.

Т.к. duckdb не клиентский сервис, а поднимаемая нами по вызову программа, то можно поднимать много экземпляров duckdb на разных машинах, которые имеют доступ к общим данным. В теории можно масштабировать количество мощностей, главное организовать общий доступ к данным на сетевом диске.

Первые впечатления от построения своего DuckLake — офигеть как всё просто. SQL-диалект гибкий, полный готовых функций на любой случай жизни, а также легко подключаться к любым внешним источникам, никакой ETL инструмент другой и не нужен. Но далее всплывают, конечно, подводные камни: как настроить лимиты по памяти, как подключиться извне через IDE или BI-инструмент, почему падают параллельные DDL-запросы...

Технология пока сыра, но я в ней вижу большое будущее для средних и не очень компаний. Продолжение следует!
  • ❤ 5
  • 🔥 4
  • 👍 2
  • 🤯 1
Post #213 469
Flipper's place Мы с приятелем в НИИ программируем ИИ…Ну что это конец старой хайп парадигмы и переход в новую. Не все это еще поняли похоже. Прогрессия цены за последние три больших релиза Антропика 3-5-10. Наступает новая эра сразу в нескольких плоскостях. Во-первых, заканчивается…
Люблю иногда читать этого автора, финансист с Физтеха — каким я когда-то мечтал себя видеть.
Разве что с оформлением постов он не так заморачивается как я...

В общем мысль его про карманный PhD за 20 баксов в месяц настолько проста, что не поспоришь. Те возможности, которые открывает подписка на Claude/Codex за 20 баксов (это полторы тысячи рублей по текущему курсу, если что), это невероятное предложение по цене/выхлопу.

Такая подписка на ИИ стоит чуть ли не дешевле похода в кафе, но позволяет выполнять огромное количество работы, которое конвертируется в несоразмерно бОльшие деньги.

Но может ли быть такая щедрость вечной? Не думаю. Если что, то собрать домашний ИИ-сервер будет стоить пару десятков тысяч долларов, а модели на нём будут запускаться тупее, чем предоставит вендор по подписке. Да, пожалуй я уже повторяюсь: нас подсаживают на дешёвый ИИ-кайф, когда задачи сами магическим образом решаются за считанные минуты, а потом нас заставят платить не 20, а 200 долларов, а через какое-то время и все 2000.
  • 💯 6
  • ❤ 5
  • 🔥 5
  • 🤯 2
Post #212 430

Forwarded from Flipper's place (G)

Мы с приятелем в НИИ программируем ИИ…Ну что это конец старой хайп парадигмы и переход в новую. Не все это еще поняли похоже. Прогрессия цены за последние три больших релиза Антропика 3-5-10. Наступает новая эра сразу в нескольких плоскостях. Во-первых, заканчивается эра безудержных субсидий всего и вся это уже свершившийся факт. Как я уже писал не раз просто нет столько капитала, слишком большие суммы. Антропик это знает и не боится что его кто-то пере субсидирует тут сейчас уже больше и поэтому поднимает ценник на последнюю модель еще в два раза. Весь «большой ИИ» американский – это олигополия, как-то договорятся под ковром сбавить градус капексов и прочих расходов. Во-вторых, это официальное признание конца старой парадигмы и хайпа что всем дадут по своему карманному 24/7 Phd за 20 баксов в месяц. Модель будет другая – продвинутые тулзы будут для продвинутых людей за большие деньги. Дадут, но не всем, не за 20 и даже не за 2 тыс видимо, и не для всех юз кейсов. Еще более важно что это первая модель которая пытается ограничить свое использование для разработчиков конкурирующих продуктов и не только. Т.е. Антропик опять же признал конкретно что оупен сорс это проблема и надо с ней что-то делать иначе придется вечно работать в минус. Признал при этом с позиции силы, лидера индустрии, не боясь опять же конкурентов. Посмотрим чем ответят Китайцы (Мету в опен сорсе можно уже давно списать они переходят в закрытые модели). Это будет иметь очень большие последствия в итоге, но возможно постепенно будет переформатирование идти.
  • 🔥 4
  • 🤯 1
  • 💯 1
Post #211 410
Моша шарит за DuckLake
  • 🔥 4
  • ❤ 2
Post #210 488

Forwarded from Лингвошутки

Читаю, не поверите, про дата-инжиниринг, пишут, что в озере данных хранятся

🥁🥁🥁

сырые данные!
  • 🤯 9
  • 🔥 8
  • ❤ 4
Post #208 479
Lost in Data Не хочу забывать любимый (не шучу) свой дата-инжиниринг. Почему классно быть ДЕ сегодня? Потому что у нас огромный выбор разных новых технологий и нейросети, чтобы быстро их освоить. Особенно мне нравится идея DuckDB — SQL движка без привязки к конкретной…
Мой пост про DuckDB собрал незаслужено мало реакций!

Это не нытьё, но хорошая иллюстрация того, почему DE — это топ ниша.

Ещё с конца 2010-х у нас на слуху Data Science или попросту "анализ данных".

Курсы, тысячи их, как стать аналитиком данных или дата-сайентистом захватили все рекламные интеграции ещё в году 2020.

Но кто говорит про дата-инженеров? Правильно, почти никто. Но так сложилось, что работа DE идёт тесно в связке с аналитиками и DS, поэтому чем больше аналитиков => тем больше надо инженеров.

В итоге спрос на профессию со стороны работодателей растёт, но отсутствие хайпа вокруг профессии не даёт достаточно притока новых людей.

Это приводит к чему? Что даже в суровом 2026 году рынок труда DE это всё ещё рынок соискателя.

Мой хороший друг DE только вышел на рынок труда, а уже три оффера на руках, когда в других профессиях стоит стон, что рынок мёртв, работы нет.

Какие тут выводы кроме того, что быть дата-инженером топ и в 2026, несмотря на эпидемию сокращенИИй.
  • ❤ 13
  • 🤯 7
  • 🔥 2
  • 👍 1
Post #207 335
Не хочу забывать любимый (не шучу) свой дата-инжиниринг.

Почему классно быть ДЕ сегодня? Потому что у нас огромный выбор разных новых технологий и нейросети, чтобы быстро их освоить.

Особенно мне нравится идея DuckDB — SQL движка без привязки к конкретной СУБД. Работай хоть с файлами, хоть с внешними базами данных.

Ещё зимой я на каникулах баловался, строя свой Duck Lake на основе DuckDB+parquet для работы с данными биржевых торгов.

Оказывается теперь DuckDB совместим с dbt и может быть использован для построения витрин данных.

Другие предлагают использовать DuckDB для Extract-Load задачи выгрузки данных из одного источника в другой.

А у вас есть опыт работы с DuckDB?
  • ❤ 7
  • 🔥 3
  • 🤯 2
Older posts →

About this channel

How can I read @dwh_expert without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Lost in Data: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Lost in Data have?
Lost in Data (@dwh_expert) has 442 subscribers on Telegram, refreshed roughly every 30 minutes.
Does Lost in Data know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →