Stage 1️⃣: Генерация CoST-трейсов с GPT-4o
Сначала GPT-4o генерирует Chain-of-Structured-Thought (CoST) трейсы: анализирует запрос, выбирает структуру (таблица/граф), строит схему, извлекает данные, проверяет качество и уточняет итеративно, если ответ не совпадает с референсом. Таким образом мы получаем и трейс, и структурированный контекст как вывод (SSO) — таблицу или граф.
Stage 2️⃣: Адаптация SLM через SFT + GRPO
Трейсы используются для обучения SLM: LLaMA-3.2-3B-Instruct (3B) и Qwen2-7B-Instruct. Для обучения использовались данные из FinQA (8k), TAT-QA (16k), SQuAD (100k+), LegalBench (6.8k) — всего <200k семплов. Сначала SFT для структуры/формата, затем GRPO с ревордом на ответ, соблюдение формата и консистентность каждого шага reasoning к референсному трейсу.
🏆Результаты: SLM на уровне GPT-4o
На Loong-бенчмарке обученные модели сильно превосходят базовые: LLaMA-3B +27.6% accuracy, Qwen-7B +17.8%. Qwen-LiteCoST обходит Qwen2.5-14B, GPT-4o-mini и GPT-4o по общему счёту (79.93 vs 79.32), работая в 2–4 раза быстрее.
🧠Takeaway:
Достаточно очевидный: структурирование контекста для long-document QA сильно улучшает качество, а LiteCoST позволяет достичь этого с помощью компактных SLM без постоянных вызовов дорогих LLM
🌐Рандомные галлюцинации