Почему ИИ допускает галлюцинации в переводе и как от них избавиться
Коллеги Ольга Береговая и Алекс Янишевский выпустили интересную статью в мартовском Multilingual (пока закрыта пэйволлом, можно послушать начитку роботом тут).
Мне понравилось, потому что очевидные причины расписаны более техническим языком, но без математической нудятины. Я плохо воспринимаю технические тексты, поэтому тут мне было в самый раз.
Кратко поделюсь выводами. Причины глюков в переводах:
🔠 Несоответствие модели задаче
NMT — нейросети, заточенные на машинный перевод, могут обучаться на нужном языке. Они выдают действительно рабочий консистентный текст, и их можно доучивать и совершенствовать. Но они узконаправленные и широкого контекста не понимают. А вот привычные нам всем LLM заточены на всё подряд, и перевод для них — лишь одна из множества задач. Да, при переводе опираются на междисциплинарные знания и учитывают широкий контекст. Но именно из-за этого и начинают додумывать и глючить.
🔠 Проблемы с токенизацией
Машина переводит не слова, а токены. Токеном может быть что угодно — хоть знак препинания, хоть буква. Но в Азии-то иероглифы. И тут ИИ давится, даже если дать ему широкий контекст.
🔠 Неверная настройка температуры, то есть баланса креативности и предсказуемости
Чем выше температура, тем более рандомизированные токены берёт машинка. Перевод при этом может получаться более естественным, зато нашпигованным ошибками или не пойми откуда взявшимися деталями.
🔠 Плохой промпт
ИИ умеет понимать промпты с ошибками. И даже если у вас получилась нелогичная простыня, он может это как-то собрать воедино. Но вот разница в тоне и впихивание сразу нескольких сфер контекста (типа, искусство плюс строительство) могут привести к галлюцинациям и неконсисту.
Чем это всё лечить:
💊 Выбирать нужную модель под конкретную задачу.
💊 Снабжать машину широким контекстом. Для АВП — давать ссылки на Вики, статьи про нужных людей или реалии. Применять RAG — Retrieval Augmented Generation, то есть давать машине источники для самопроверки: ТМ, глоссарии, стайлгайды и всякое такое. Ну и включать DeepThink, чтобы она ходила сама себя проверять и предоставляла вам источники.
💊 Для серьёзных технических, медицинских и юридических текстов проводить автоматическую проверку на соответствие заданным правилам, а также автоматическую редактуру со сравнением оригинала и перевода по семантическому родству и лексической точности. И звать человека, конечно же, всё это верифицировать.
💊 Научиться нормально писать промпты. Прописывать машине конкретные условия: например, в техническом тексте велеть прямо писать "Я не знаю", если ИИ не находит соответствия термину. Последовательно и чётко описывать все правила и исключения. Тут я с авторами согласна — один мой рабочий промпт занял что-то вроде шести-семи страниц.
🔤 А ещё лично я развлекалась тем, что давала переведённый машиной и отредактированный мной текст на проверку другой модели. Она подсвечивала места, которые ей казались неудачными, и я их дорабатывала уже вручную. По-моему, это всяко интереснее back translation, которым баловались видные зарубежные бюро лет 12 назад.
Post #395
338
- 🔥 13
- ✍ 5
- ❤ 2
- 🤨 1