A LITE BERT (ALBERT) — это оптимизированная версия BERT от Google.
В статье «ALBERT: облегченный BERT для самообучения языковым представлениям», была представлена обновленная версия BERT’а, которая показывает более высокие результаты в 12 задачах обработки языка.
ALBERT основана на архитектуре стандартного BERT, но модифицирована с помощью 2-х методов.
Методы:
• Матрица векторных представлений слов делится на 2 маленькие матрицы: размер скрытых слоев напрямую отделяется от размера векторов (factorized embedding parameterization);
• Нейросеть передает параметры между слоями, чтобы параметры не росли с увеличением глубины нейросети (cross-layer parameter sharing).
На картинке представлено сравнение размеров стандартного BERT и ALBERT. Показательно то, что увеличение размера модели на этапе предобучения векторных представлений слов часто результирует в улучшение качества предсказаний.
Успех ALBERT демонстрирует важность выявления аспектов модели, которые помогают создать мощные контекстные представления.
Post #182
1.47K
