TGViewer
Костя 8Бит | Fullstack AI Костя 8Бит | Fullstack AI @kostya_web_dev · 1.02K subscribers
Post #271 730
Самый частый вопрос на собеседованиях для ИИ-инженера

Везде где я проходил собесы всегда присутствовал вопрос про качество выдачи результата нейронки (evals). Не важно это отдельный сервис, отдельный агент или просто написания кода за счет клода/кодекса.

1. Написание кода
Зачем спрашивают? Отсеять тех кто просто промптит, а не имеет настроенный процесс. На одном собесе мне напрямую сказали, что кто просто промптит мы не рассматриваем.

Тут я всегда рассказываю про свой подход работы своего воркфлоу.
В своей работе у меня несколько паттернов для решения задачи:
если задача большая:
- спличу на мелкие куски аналитику
- разбиваю на изолированные подзадачи
- по каждой позадаче провожу детальную аналитику + ресерч по коду. оформляется в конце в виде артефакта
- синтезирую инфу из артефактов и собираю как можно больше корнер кейсов, ищу потенциальные трейдоффы, слабые места
После этого только начинаю делать тех диз + ревью тех диза. Тут я провожу больше всего времени. Схемы, связи, архитектура.
Смотрю как это все встраивается. Если все ок, апрувнул далее просто запускаю воркфлоу по SDLC. Результат в 90% очень качественно выдается и нет проблем.

2. ИИ-фича/ии-агент
Зачем спрашивают? Узнать твой опыт, какие подходы, паттерны знаешь.
Тут есть много разных подходов, но самые частые, которые я использую это:
- детермированная структура (json или другие)
- агент-критик/судья
- golden dataset

Важно чтобы критика осуществлялась другим агентом/моделью. На селф ревью нейронка может легко ошибиться и выдать желаемое за действительное. Поэтому агента-критика создаю отдельно или вызываю другую модель.

Golden dataset очень мощная практика на большом обьеме данных. Условно есть 10к записей где нужно по шаблону что-то поменять. Нейронка 100% налажает где-то. Поэтому я бью весь обьем на чанки по 1к, прогоняю весь процесс и отдельно делаю себе датасеты с результатами: идеально, приемлемо, брак.
После этого уже отдельной проверкой сравниваю еще раз. Фактически сравниваю это с выдачей.

По детермированной структуре все достаточно просто. Говорю какой нужен output, обязательное соблюдение таких и таких параметров и дальше уже сама проверка происходит гораздо легче.

Вопрос про качество самый частый который у меня был и наверное самый важный.
В моем курсе будет отдельный ролик про качество и полноценный развернутый ответ на этот вопрос.
  • 👍 12
  • 🔥 2
  • ❤ 1
More from @kostya_web_dev
  1. Sep 23, 2026Рынок мёртв. Ничего не поделать (почти) По моим ощущениям, с 2024 года работу стало находи…
  2. Sep 22, 2026Сезон начался В сентябре hr прям активизировались, много пишут на линке/хх. Данная позиция…
  3. Sep 22, 2026Нам никогда не внедрить ИИ правильно Вот тут упомянул одну из серьезных проблем на текущий…
  4. Sep 21, 2026Как я не нашел работу, а потом Бац и нашел! Свитч в ии-инженера Последние годы меня подбеш…
  5. Sep 18, 2026Голодные эйчары пишут сами После летнего затишья эйчары активно начали писать по вакансиям…
  6. Sep 17, 2026Да я вообще все знаю про агентов и ИИ Пообщался с тимлидом из одной крупной ритейл компани…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →