Ответ
BERT (Bidirectional Encoder Representations from Transformers) предобучался на двух задачах без учителя, что позволило ей освоить глубокое контекстное представление языка.
1. Masked Language Modeling (MLM)
- Суть: Случайные токены (обычно 15%) во входной последовательности заменяются на специальный токен
[MASK]. Задача модели — предсказать исходное слово на основе контекста с обеих сторон. - Пример:
- Исходный текст:
"The quick brown fox jumps over the lazy dog." - Замаскированный ввод:
"The [MASK] brown fox jumps over the [MASK] dog." - Модель учится предсказывать
"quick"и"lazy".
- Исходный текст:
- Важность: Это делает BERT двунаправленной моделью, в отличие от однонаправленных (вроде GPT), что критично для понимания контекста в таких задачах, как NER или извлечение ответов.
2. Next Sentence Prediction (NSP)
- Суть: Модели на вход подаются два предложения. Она должна классифицировать, является ли второе предложение логическим продолжением первого в исходном документе.
- Примеры пар:
- Положительная:
["Кошка сидела на коврике.", "Она мурлыкала от удовольствия."] - Отрицательная:
["Кошка сидела на коврике.", "Вчера я ходил в магазин за хлебом."]
- Положительная:
- Цель: Научить модель понимать отношения между предложениями, что необходимо для задач вроде Question Answering (SQuAD) или Natural Language Inference (NLI).
Итог: Комбинация MLM и NSP дала BERT мощные представления, которые затем можно эффективно дообучать (fine-tune) на широком спектре downstream-задач с относительно небольшими размеченными данными.