TGViewer
AI и грабли AI и грабли @oestick · 13.7K subscribers
Post #317 1.19K
Кстати пост выше – единственный на канале, написанный GPT.

Я добавил только предложение про предыдущие собесы. И убрал про кофе.

Как вышло, что я даже не стал редачить? Раньше меня не устраивало качество того, что пробовал генерить. Чем отличается этот раз?

А в этот раз я добавил в контекст выгрузку своих предыдущих постов за пол года. А потом еще и попросил проанализировать меня вот этим промптом. Еще пару расплывчатых запросов голосом и готово. Тут переписка.

А теперь ради чего я пишу этот пост:

Нельзя просто бездумно кидаться в GPT большими файлами!

По крайней мере, когда нужно показать ей весь контент.

Просто найти какой-то один кусок инфы – проблем нет. А вот если сделать какое-то саммари, выводы, связать разные части друг с другом, то все плохо.

Все дело в том, как GPT работает с файлами. На пальцах:

1. Файл разбивается на кусочки (с нахлестом)

2. Для каждого запроса пользователя ищутся похожие по смыслу кусочки (магия семантического поиска, нам тут не важно как она работает)

3. Кусочки помещаются в обычный запрос к GPT типа "используя эту инфу: {кусочки} ответь на изначальный вопрос: {вопрос}"

И вместо того, чтобы видеть весь файл, LLMка видит жалкие огрызки.

Но у меня же тут сработало?!

Я сам удивился. Изначально я вообще делал этот эксперимент с анализом личности по постам, как иллюстрацию, что это не работает. Радует привычка искать пруфы своим спекуляциям

Пришлось покопаться, чтобы найти объяснение. Оказывается, в работе чата все не так просто устроено.

Первые 110k токенов документа попадают в контекст целиком.

«И че?» для простых пользователей:

Если нужно, чтобы ИИ видел весь документ целиком, проверьте, что текст не превышает лимиты. Для пдф файла без картинок – смотрите, если он больше 1.5 МБ, это уже много.

«И че?» для ИИ разработчиков:

Даже сами OpenAI в своих продуктах не используют голый векторный поиск, а добавляют большие куски инфы напрямую в контекст. Берем пример.
  • 👍 17
  • ❤ 1
  • 🔥 1
  • 🤔 1
More from @oestick
  1. Oct 4, 2026Саша Поляков собрал стату по банам (меня тоже в этот раз задело). Мб кому-то полезно будет…
  2. Oct 4, 2026Собрал статистику по банам Claude из комментариев в канале Пост с разбором телеметрии, кот…
  3. Oct 2, 2026О, мой баг репорт в getbb.app приняли. Приятно быть причастным к развитию того, чем сам по…
  4. Oct 1, 2026А у вас тоже есть задачки, в которых нужно очень много и глубоко думать, но вы их откладыв…
  5. Sep 30, 2026Anthropic > OpenAI, но есть пара но Предпосылки 1. opus-5.5 очень хорош 2. DevDay openai –…
  6. Sep 27, 2026Скоро: видео-монтаж-слоп во всех лентах страны Opus-5.5 теперь сам такое ваншотит на remot…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →