TGViewer
Channel Public Channel
Геолог-программист

Геолог-программист

@geologistprogrammer

В этом канале делюсь различными рекомендациями и контентом, который считаю полезным или интересным. Как правило, контент связан с программированием в геологии.
Чат по программированию и ML: https://t.me/GeoMLearning
Subscribers
1.02K
Photos
70
Videos
23
Links
83
Recent Posts 14 shown
Post #191 202
Scispace\perplexity на коленке

С чего на самом деле начиналась история ИИ - ассистента?
На самом деле - первоначальная задумка - создать непосредственно помощника исследователя, аналогичного перечисленным в заголовке.

Как они работают?
Как правило - это некоторая большая языковая модель или ряд отдельных БЯМ вокруг которых есть разные инструменты - это всё объединяется в харнес-систему (harness - упряж), где множество агентов одновременно выполняют различные задачи.
Главная модель (как правило - самая большая) - является оркестратором, которая знает сильно больше других, и ряд маленьких - у них в контексте четкая задача и небольшой набор инструментов для них.

Например, вы отправляете запрос "Создай подборку статей про рудоносность золото‑сульфидных месторождений Восточной Сибири за последние 5 лет".
Оркестратор раскидывает задачу:
— один агент генерирует ряд запросов для поиска, вытаскивает DOI / аннотации, научные метаданные;
— второй шерстит открытые источники — eLibrary, КиберЛенинку, сайты институтов;
— третий собирает всё в единую таблицу: title, authors, year, url, relevance_score.
Дальше эта информация может разными способами векторизоваться\индексироваться и собираться в базу, с которой может работать другой агент.

Технический стек
Сама обвязка может состоять из разного, для конкретно нашей цели - нужен минимум RAG (Retrieval-Augmented Generation, генерация с поиском по базе) и, собственно, источники информации, которые должны базу заполнять, ну и технологический стек, основанный на российских технологиях, чтобы голова не болела.

С точки зрения индексации баз по науке существует несколько систем научного цитирования, colab.ws и РЦНИ. У того и у другого есть апи и вроде бы как оба доступны.
Ребятам из колаба можно написать в чат - быстро ответят и решат все вопросы, со вторыми сколько не пытался связаться, к сожалению, так и не получил ответа, при этом что отправлял несколько запросов с разных адресов.

Кроме научных баз - полезно собирать данные и статьи из интернета - для этого используется апи яндекса, оно доступное и достаточно бюджетное.
Ну и сама языковая модель - гигачат, на мой вкус - он отвечает лучше других с точки зрения русского языка и у них сразу есть модель для эмбедингов.

Результаты
В целом, система получилась более менее рабочей, но пока что сильно требовательно по ресурсам с точки зрения запросов - в тот же самый колаб может улетать до 100 запросов на поиск разной литературы. Также далеко не всегда можно скачать PDF, что усложняет создание базы для RAG и пока что требует частого вмешательства, ну и написание статей у меня пока не в приоритете, поэтому это больше остается экспериментом и интересным опытом.
Ну а что в приоритете - это вторая версия системы автоматического описания керна, про которую, наконец, скоро смогу рассказать много подробностей :)

@geologistprogrammer | VK | max
  • 👍 6
  • ❤ 1
  • 🔥 1
Post #190 263
Сделал личного ИИ-ассистента

Есть много задач, которые требуют много времени но не особо мне интересны (заполнение документов, подача написанных статей в журналы и пр.), кроме того для обновления курса - надо проанализировать как предыдущие лекции, так и обновленные и составить конспекты\вопросы\тайм-коды.
Как это всё автоматизировать?

Думаю, многие слышали про автоконспектирование, но, как правило, всё запускается в облаке — ассистент может положить запись в открытую ссылку без пароля — далеко не всегда это может быть хорошей опцией.
Собственно, потому и пришла идея взять готовое и адаптировать под личные задачи.
Первоначально — делал MVP на ноутбуке — начал с whisper.cpp. Проблема с ней в том, что она генеративная, зацикливается (делает вид, что расшифровка идёт, но генерирует одну и ту же фразу) + требовательна к памяти. Тем не менее, подход оказался рабочим, расшифровка получалась, но что с ней делать? для последующей обработки — нужна локальная LLM. Та же история с зацикливанием, если модель небольшая.

После ряда экспериментов — MVP себя оправдало, но как вы сами догадались — вычислений много, да и ноутбук надолго не оставишь включенным. Некоторое время думал над вариантами и купил мини-сервер (помещается буквально на ладони) с 128 ГБ объединённой памяти и Ryzen AiMax. Расчёт был на то, что под примерно такие характеристики и оптимизируют открытые модели. На данный момент расчет уже оправдал себя, поскольку недавно вышедшая квантизированная Qwen 3.8 (125 млрд, инференс по 6млрд) там вполне может жить и генерировать ответы со скоростью до 30 токенов/с (может падать до 15, если контекста много). Этого вполне хватает, чтобы поставить задачу и уйти заниматься своими делами, в целом, модель подходит, в т.ч. для генерации кода.

В итоговом решении — LLM от 32B параметров, GigaAM (сберовская модель, которая не страдает от зацикливаний) + pyannotate только для своего голоса, чтобы разметить фрагменты речи, тишину, и другие моменты.

Аппетит приходит во время еды, да и зачем такому железу простаивать — поэтому повесил туда локального бота. Можно скинуть свое голосовое с описанием задач\результатов и на выходе получить задачи для отправки в трекер. Связка с Telegram / почтой / Яндекс.Трекером / YouGile / Max — может быть настроена, можно, например, запрашивать план задач на сегодня.

Как может работать в теории
Отправляешь запись → на выходе расшифровка, задачи для каждого и мемо. Всё локально.

Но начиналось, на самом деле, всё с немного другой идеи, которая требует ещё больших ресурсов — об этом завтра ;)

@geologistprogrammer | VK | max
  • 👍 16
  • 🔥 3
  • 👏 1
Post #189 511
Сделано за лето:

Создан полностью локальный секретарь на основе GigaAM + Gemma 4 + RyzenAiMax.

Освоена новая репка (Repka Pi 5) - кое-какие подробности уже можно найти в моих постах в блоге репки.

Доведена до предрелизного состояния (переписано всё, весь функционал первой версии работает, осталось довнедрить новый) система автоматического описания керна второй версии.

Работаю над второй версией курса по программированию с нейропомощниками для геологов.

Подробнее всё опишу в следующих постах, остаемся на связи🤝

@geologistprogrammer | VK | max
  • 🔥 12
  • 👍 2
  • ❤ 1
Post #187 1.01K
Что происходит в 4 утра?

Появляется темная тема в нашей системе автоматического описания керна.
Буду завтра показывать вторую версию в рамках МингеоФорума, можно посмотреть в онлайн на геовебинарах в сессии Кибергеология.
https://geowebinar.com/mingeo-2026

@geologistprogrammer | VK | max
  • 👍 7
  • 😁 3
  • 🎉 1
Post #186 968
Видео про большие языковые модели для геологов.

Продолжаю кататься по конференциям, решил попробовать такой формат по части образовательных видео, чтобы оставаться с вами на связи - коллеги из Soilbox помогли в реализации - записали видео выступления на ГеоИнфо.
Смотреть тут на вк видео https://vkvideo.ru/video-221089833_456239022
Пишите по формату в комментариях в ВК или тут.

@geologistprogrammer | VK | max
  • 👍 7
  • 👀 1
Post #180 1.13K
А перед сессией можно заглянуть к коллегам из ТехноИнфо в соседней Аналитике. Они собрали обещанную установку для сканирования керна.
Уже готовим нашу систему к их данным.

@geologistprogrammer
Post #179 811
Месяц конференций, не успеваю всем делиться, но скоро исправлюсь, спасибо, что остаетесь на связи 🤝.

На прошлой неделе был на конференции по инженерной геологии, рассказывал про применение больших языковых моделей (скоро будет видео), а сегодня - по рудной геологии в рамках Miningworld и Мингеоофрума на сессии 'Кибергеология', начало в районе 15-16, приходите, будет интересно.
UP, зал G сразу справа после экскалаторов, не входя на выставку.

@geologistprogrammer
  • 🔥 3
Post #178 886
С днём геолога! Интересных проектов, творческих идей и вдохновения для новых открытий!
  • ❤ 20
  • 🍾 2
  • 🔥 1
Post #176 966
Сегодня на геоевразии, из интересного - познакомился с компанией из Индии, которое оборудование для шлифов делает.

Буду сегодня в 14 часов в 4 зале делать доклад про применение машинного обучения без обучения (детектируем слои без необходимости предварительно обучать алгоритмы).

Если вы тоже тут -буду рад пообщаться.

@geologistprogrammer | VK | max
  • 👍 12
Post #175 866
Я учился в кибердеревне.

Недавно пришел к такой мысли, ведь где еще можно собрать свою робособаку, как не в Сколтехе?

Как многие знают, я не ищу легких путей, ведь это слишком скучно. Именно поэтому в какой-то момент я принял решение продолжить обучение в другом вузе, это позволяет сильно расширить ваш кругозор и узнать много нового, посмотреть на старые проблемы с нового ракурса.

Так и случилось. В Сколтехе не только обучение на английском, но и совершенно другой взгляд на многие вещи, направленный на практическую реализацию, так и получился проект по автоматическому распознаванию керна.

Сложно описать, сколько всего узнаешь о мире и людях в процессе бесконечного улучшения. Ну и, конечно, без кооперации не обходится, скоро будем внедрять много нового ;)

Узнавайте новое, это всегда полезно, тут вот можно с программами ознакомиться https://student.skoltech.ru/ru, там теперь магистратура, аспирантура и бакалавриат, кстати, на тот же Petroleum Engineering поступают далеко не только нефтяники, но и инженер-геологи и другие специальности.

Пишите, где еще можно собрать свою робособаку или кардинально изменить взгляд на мир👇

@geologistprogrammer | VK | max
  • 👍 3
  • ❤ 2
Post #174 676
Post #173 808

Forwarded from Ассоциация геологов, геофизиков и инженеров

🤖 Хакатон по машинному обучению — ваш шанс проявить себя перед крупной нефтегазовой конференцией!

В преддверии конференции Интеллектуальный анализ данных в нефтегазовой отрасли приглашаем всех желающих принять участие в захватывающем Хакатоне по машинному обучению!

Что вас ждёт:

❇️ 4 разноплановые задачи — от классического анализа табличных данных до передовых методов научного машинного обучения (Scientific ML).
❇️ Свобода выбора направления под ваши интересы и компетенции: компьютерное зрение, физико‑информированные нейросети, алгоритмы сжатия данных, работа с геохимическими данными.

💡 Почему стоит участвовать?

- прокачать навыки на реальных задачах нефтегазовой отрасли.
- поработать в команде с единомышленниками.
- получить опыт решения прикладных задач с использованием ML.

Участвуйте, ищите интересные необычные решения задач, и выигрывайте ценные призы за свои творческие способности, эрудированность и гениальность🤓😉

Принять участие 👈

ps.: Присоединяйтесь к нам в наших других соцсетях:
Группа Вконтакте: https://vk.com/geomodel_conferences
Канал в Max https://max.ru/id9725125483_biz
  • ❤ 5
Post #172 571
И ещё один 👇 хакатон :)
Post #171 688
Сразу несколько хакатонов и все по ДЗЗ, успевайте зарегистрироваться (у всех окончание регистрации 31 марта):

Экспедиция DS. призовой фонд — 15 000 000 ₽.
Регистрация https://expds-platform.upgreat.one
Подробнее тут https://upgreat.one/contests/expds

Разработка геосервисов систем управления природопользованием
https://sgugit.ru/events/otkrytyy-khakaton-po-razrabotke-geoservisov-sistem-upravleniya-prirodopolzovaniem-/

ГИС-ИТ (до 30 лет)
https://gisit.ru/#registration

@geologistprogrammer | VK | max
  • 👀 2
Older posts →

About this channel

How can I read @geologistprogrammer without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Геолог-программист: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Геолог-программист have?
Геолог-программист (@geologistprogrammer) has 1.02K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Геолог-программист know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →