На каких задачах обучалась модель BERT?

«На каких задачах обучалась модель BERT?» — вопрос из категории NLP и трансформеры, который задают на 26% собеседований Data Scientist / ML Инженер. Ниже — развёрнутый ответ с разбором ключевых моментов.

Ответ

BERT (Bidirectional Encoder Representations from Transformers) предобучался на двух задачах без учителя, что позволило ей освоить глубокое контекстное представление языка.

1. Masked Language Modeling (MLM)

  • Суть: Случайные токены (обычно 15%) во входной последовательности заменяются на специальный токен [MASK]. Задача модели — предсказать исходное слово на основе контекста с обеих сторон.
  • Пример:
    • Исходный текст: "The quick brown fox jumps over the lazy dog."
    • Замаскированный ввод: "The [MASK] brown fox jumps over the [MASK] dog."
    • Модель учится предсказывать "quick" и "lazy".
  • Важность: Это делает BERT двунаправленной моделью, в отличие от однонаправленных (вроде GPT), что критично для понимания контекста в таких задачах, как NER или извлечение ответов.

2. Next Sentence Prediction (NSP)

  • Суть: Модели на вход подаются два предложения. Она должна классифицировать, является ли второе предложение логическим продолжением первого в исходном документе.
  • Примеры пар:
    • Положительная: ["Кошка сидела на коврике.", "Она мурлыкала от удовольствия."]
    • Отрицательная: ["Кошка сидела на коврике.", "Вчера я ходил в магазин за хлебом."]
  • Цель: Научить модель понимать отношения между предложениями, что необходимо для задач вроде Question Answering (SQuAD) или Natural Language Inference (NLI).

Итог: Комбинация MLM и NSP дала BERT мощные представления, которые затем можно эффективно дообучать (fine-tune) на широком спектре downstream-задач с относительно небольшими размеченными данными.