TGViewer
Гостев из будущего Гостев из будущего @gostev_future · 1.41K subscribers
Post #460 1.24K
В прошлой серии Anthropic покупала книги, отрезала им переплеты и превращала в training data. Оказалось, это был не эксцентричный художественный перформанс отдельно взятой компании, а вполне нормальный производственный процесс новой экономики.

Журналисты 404 Media решили выяснить, кто ещё скупает у букинистов книги партиями по тысяче штук. Метод выбрали простой и надёжный: положили AirTag внутрь одной книги и стали смотреть, куда она поедет.

Книга прошла через несколько логистических центров и в итоге приехала на склад Amazon в Лас-Вегасе, в подразделение VGT3.
Сотрудники VGT3 рассказывают, что там делают ровно то же, что Anthropic в Project Panama: принимают книги, сканируют ISBN, срезают переплёты и прогоняют страницы через сканеры. Amazon подтвердил, что действительно покупает книги «для разработки и улучшения продуктов и сервисов».

Похоже, что здесь есть бизнес-идея.

Пока AI-компании работают с самым простым пластом. Есть ISBN, есть маркетплейсы, есть миллионы книг, которые можно автоматически найти и купить. Фактически ISBN — готовая карта месторождений: вот книга, вот продавец, вот цена.
Но огромные пласты человеческого текста вообще не имеют ISBN и никогда не попадали в интернет: например, советские технические сборники, ведомственные издания, заводские каталоги, материалы конференций, старые учебники, региональные издания, книги малых тиражей.

И вот здесь появляется перспективная профессия будущего — скупщик металлолома геолог данных.

Компания не сканирует всё подряд. Она сначала определяет, каких знаний не хватает конкретной модели. Затем ищет физические источники, которых нет в интернете: у букинистов, в частных коллекциях, на складах закрытых издательств, в распродаваемых корпоративных собраниях.

После чего приходит к OpenAI, Amazon или Anthropic и говорит: «У вас плохо покрыта советская металлургия 1960–1985 годов. Мы нашли 1840 физических источников, которых нет в вашем корпусе. Можем их легально приобрести, оцифровать и собрать в отдельный dataset».

То есть возникает новая цепочка: найти белое пятно в знаниях модели → найти физические источники → выкупить → оцифровать → продать уникальный датасет.

Когда-то нефтяные компании отправляли геологов искать нефть. Теперь AI-компаниям понадобятся другие геологи — искать места, где человечество что-то написало, но интернет до этого ещё не добрался.
Первое издание Диккенса может стоить десятки тысяч долларов и быть бесполезным для модели: его текст давно оцифрован. А какой-нибудь советский сборник 1974 года за триста рублей может оказаться единственным источником нескольких сотен страниц, которых модель никогда не видела.

Следующий дефицитный ресурс — off-web human data.

Фактически появляется рынок месторождений человеческого текста, который ещё не был добыт интернетом.

И тот, кто первым научится составлять карты этих месторождений, искать их и превращать в готовые для обучения, получит очень неплохой бизнес.
 
@gostev_future
  • 🔥 14
  • 👍 5
  • 🤔 2
  • 🤬 1
More from @gostev_future
  1. Sep 22, 2026Помните исследование о том, как ИИ играет в Civilization? А вот мой однофамилец Питер Гост…
  2. Sep 20, 2026Я уже писал о недавнем аресте австралийца Рубена Томсона из TeamPCP, который, при всех сво…
  3. Sep 20, 2026У президента с высочайшим IQ есть любимое занятие — что-нибудь переименовать. Мексиканский…
  4. Sep 19, 2026Сегодня в России проходят выборы, и в этой связи для цикла «Гостев из прошлого» у меня тож…
  5. Sep 18, 2026На этой неделе много обсуждали, как руководители крупнейших американских ИИ-лабораторий вд…
  6. Sep 18, 2026Похоже, у нас появился новый жанр. Помните, как Claude Fable 5.1 «решил шифр, который чело…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →