Офер Прес из SWE-bench жалуется, что стало сложнее собирать датасеты для coding agents: платишь разметчикам за “человеческие” задачи, а они сами генерят их через LLM. Формально это human-written data, по факту - synthetic data laundering.
И это хуже обычного синта: обычный синт хотя бы подписан как синт. А тут модельные данные проходят через человека-прокси и возвращаются в пайплайн как “реальные” задачи, хотя там уже нет настоящего пользователя, настоящего бага и настоящего продакшен-контекста.
Это значит что результаты почти всех не синтетических бенчмарков (типо терминал бенч), которые мы сейчас видим, вероятно, завышены. Так как какая-то часть заданий сделана через агентов, а Llm biased на простые задачи, которые сама понимает как решать.
https://x.com/OfirPress/status/2060921480473465081
Post #271
1.75K