Ещё в качестве мыслей вслух, по ощущениям практически неизбежно крупные ИИ игроки начнут создавать у себя, рано или поздно, публичную дата инфраструктуру к наиболее востребованным ресурсам, в первую очередь, но не исключительно, открытым.
Потому что очень многие запросы к ИИ агентам приводят к тому что те "долбятся в открытые ворота", создают существенно более избыточное число запросов и сталкиваются с ограничениями, как по rate-limit, так и полной блокировке за WAF. Причём проблема нарастает, явно и однозначно, довольно стремительно. В блоге Интернет архива уже есть текст об этом, по моим наблюдениям, похожая ситуация с Википедией и вскоре будет с Common Crawl.
Но в Common Crawl ИИшный бигтех уже влили немало финансирования, другим повезло поменьше.
Я, кстати, пока недостаточно хорошо понимаю взаимоотношения ИИ игроков и Microsoft/Github, потому что все они создают нарастающую нагрузку на их инфраструктуру. Возможно порядками нарастающую. Платят ли Github'у за ускоренный доступ/отсутствие блокировок или ещё нет?
При этом есть базы данных которые легко склонировать, например, Википедию и маршрутизировать обращения туда, а вот склонировать тот же Интернет архив уже очень и очень сложно (а Github просто невозможно).
К примеру, когда я поручаю ИИ агенту собрать данные по общине/общинам в Армении, он стучится именно в Википедию по умолчанию. Не в Data Commons от Google, и не в DBPedia и уж точно не в, да не упомянуть лишний раз это, в какой-нибудь Рувики.
Зато обращений к базам ООН уже много и будет нарастать, они будут закрываться через Cloudflare и другие WAF, те же данные статистики ООН или Всемирного банка в зоне того же риска, сильно нарастающей нагрузки.
#thoughts #opendata #aiagents
Post #7806
369
- ✍ 3
- 👍 3
- ❤ 1
- 💯 1