Вы прочитали 2 из 3 бесплатных методичек сегодня
Безлимит →
Экстракт 30 января 2019

Освойте архитектуру BERT: от теории двунаправленного обучения до внедрения в NLP-задачи

Yannic Kilcher · Yannic Kilcher Верифицирован 40:13

Глубокое обучение для обработки естественного языка (NLP) с использованием трансформеров BERT. Подойдет Data Scientist'ам и инженерам машинного обучения, желающим разобраться в state-of-the-art моделях за 40 минут.

⚡ Зачем читать

  • Преодоление ограничений классики: Вы перестанете использовать «слепые» модели типа LSTM, которые читают текст только слева направо, и внедрите архитектуры с полноценным двунаправленным контекстом.
  • State-of-the-art мастерство: Вы узнаете, как Google AI перевернул индустрию, объединив механизмы внимания (Attention) с инновационными задачами предобучения MLM и NSP.
  • Практическая применимость: Вы научитесь брать предобученную мощь BERT и адаптировать её под свои бизнес-задачи (классификация, NER, Q&A) с минимальными вычислительными затратами.
7 тезисов 4 задания 3 цитаты ⏱ 16 мин чтения 🎯 7 тезисов
YouTube Транскрипт Сохранить
Поделиться: TG WA VK X

Для AI-агентов и LLM

Экстракт доступен в структурированном Markdown. Скачать .md · JSON API · Site index

💡 Ключевые тезисы (7)

1 Изучите ограничения однонаправленных моделей #
Проанализируйте, почему стандартные модели, такие как GPT или LSTM, обучающиеся только слева направо, упускают контекстуальную глубину. Поймите, как отсутствие «взгляда в будущее» ограничивает способность модели понимать сложные семантические связи, и перейдите к архитектуре, использующей двунаправленное внимание.
2 Примените механизм Attention #
Разберитесь в работе векторов Query, Key и Value. Научитесь вычислять внутреннее произведение для определения весов внимания, что позволяет модели динамически находить наиболее релевантные слова в предложении для интерпретации текущего токена.
3 Внедрите Masked Language Modeling (MLM) #
Освойте технику маскирования слов в предложении, заставляющую модель предсказывать скрытые токены на основе контекста с обеих сторон. Это основной метод предобучения BERT, который обеспечивает понимание двунаправленных зависимостей.
4 Реализуйте задачу Next Sentence Prediction (NSP) #
Изучите процесс классификации логической связи между двумя предложениями. Использование NSP позволяет модели лучше улавливать дискурсивные связи, что критически важно для задач ответов на вопросы и логического вывода.
5 Оптимизируйте токенизацию через WordPiece #
Используйте WordPiece для преодоления проблемы 'out-of-vocabulary' слов. Данный подход комбинирует преимущества посимвольного представления и целых слов, разбивая редкие слова на значимые подсловесные единицы.
6 Настройте архитектуру входов BERT #
Научитесь формировать входной поток, состоящий из суммы токеновых, сегментных и позиционных эмбеддингов. Поймите, как специальные токены (CLS, SEP) помогают модели различать границы предложений и структуру последовательности.
7 Выполните Fine-tuning модели для целевых задач #
Научитесь дообучать предобученный BERT под конкретные задачи (классификация текста, NER, вопрос-ответ). Добавьте минимальный классификационный слой поверх предобученной модели, чтобы достичь высокой точности с минимальными затратами ресурсов.

Освойте архитектуру BERT: от теории двунаправленного обучения до внедрения в NLP-задачи

🗺 Карта навыков

Уровень Навык Инструмент
Базовый Понимание Attention механизма Q/K/V матрицы
Промежуточный Работа с WordPiece токенизацией WordPiece vocab
Продвинутый Оптимизация предобучения (MLM/NSP) Deep Transformer
Экспертный Fine-tuning под целевые задачи PyTorch/Transformers

1. Преодоление ограничений однонаправленных моделей

Введение: Исторически NLP-модели развивались по пути последовательной обработки информации. Вспомним стандартные нейросети, такие как LSTM (Long Short-Term Memory). В таких архитектурах данные подаются «потоком»: модель видит токен «А», затем «Б», затем «В». Внутреннее состояние (hidden state) обновляется с каждым шагом, но оно «не знает», что находится в будущем. Янник Килчер в видео приводит отличный пример: если у вас есть последовательность «ABCDE», классическая модель вынуждена строить понимание контекста, опираясь только на то, что уже было «прочитано». Это фундаментальная проблема, так как человеческий язык не является строго линейным. Когда мы читаем сложное предложение, мы постоянно возвращаемся к началу или заглядываем вперед, чтобы правильно интерпретировать многозначные слова.

В видео спикер сравнивает BERT с OpenAI Transformer и ELMo. OpenAI Transformer — это модель, обучающаяся «слева направо» (left-to-right), что идеально для генерации текста, но катастрофически неудобно для его глубокого понимания, так как модель «слепа» к правой части фразы. ELMo пытается решить эту проблему путем объединения двух независимых LSTM: одна читает слева направо, другая — справа налево. Однако, как отмечает Янник, это решение «поверхностное» — конкатенация двух потоков не дает модели возможности «видеть» обе стороны одновременно при вычислении внимания для конкретного токена. В BERT же, благодаря архитектуре трансформера и механизму Self-Attention, каждый токен на каждом слое имеет доступ ко всему контексту предложения. Модель не просто соединяет два «слепых» вектора, она строит сложные зависимости между словами вне зависимости от их позиции.

Цитата: «The fundamental limitation here is that this is kind of you have information from the left and you have information from the right... but it's very shallow because it's simply a concatenation... you basically have to have blind models and then you can have concatenate. This is what BERT does: at each layer of the model, for a particular token, they look at all of the context».

✅ Сделайте сейчас: Попробуйте проанализировать предложение «Банк закрыл отделение из-за проблем с балансом». Напишите на бумаге или в коде, как обычная LSTM будет интерпретировать слово «банк» на раннем этапе (не зная, что речь идет о финансовой организации, а не о скамейке в парке), и как механизм внимания BERT «увидит» слово «отделение» и «баланс» одновременно, мгновенно скорректировав семантическое векторное представление слова «банк». Поймите, что именно эта одновременность делает BERT мощным инструментом для классификации смысла.

2. Механизм Attention: Query, Key и Value

Введение: Сердце BERT — это механизм внимания. В видео Янник подробно разбирает, как именно слова «общаются» друг с другом. Представьте, что каждое слово в предложении — это не просто статичный вектор, а активный субъект, который задает вопросы другим словам. Мы используем три вектора: Query (запрос), Key (ключ) и Value (значение). Когда модель обрабатывает токен, она формирует «запрос» (Query), чтобы найти информацию, необходимую для уточнения текущего смысла. Каждое другое слово в предложении предоставляет свой «ключ» (Key). Модель вычисляет скалярное произведение (inner product) между Query и всеми Key, получая веса внимания. Это определяет, насколько сильно текущий токен должен «прислушиваться» к соседним словам.

Примеры из видео: Янник демонстрирует это на примере поиска «субъекта предложения». Допустим, у нас есть фраза «ABCDE». Если Query ищет «субъект», он будет активно взаимодействовать с токеном, который выполняет эту роль, игнорируя остальные. После вычисления весов внимания (часто через softmax), модель берет «значения» (Value) тех токенов, которые получили наибольший вес, и создает их взвешенное среднее. Это и есть контекстуализированный вектор. В архитектуре BERT таких голов внимания (Attention Heads) десятки, и каждая из них может отвечать за свой аспект: одна — за грамматические связи, другая — за анафорические ссылки, третья — за эмоциональную окраску. Именно поэтому BERT так успешно справляется с многозначностью — слово «замок» получит разный контекст в зависимости от того, «навесной» он или «средневековый».

Цитата: «You have your query Q and you compute the inner products actually with the key... after maybe the softmax you have like a nice distribution and then you can say AHA here this is the biggest the biggest alignment of the particular key with my query... you're basically gonna get a weighted average of the values according to these values here».

✅ Сделайте сейчас: Откройте любой инструмент визуализации внимания BERT (например, BertViz) и выберите произвольное предложение с многозначным словом. Посмотрите, как меняются веса внимания при изменении контекста. Напишите небольшой код на Python, который имитирует упрощенный механизм внимания: создайте три матрицы (Q, K, V) размерностью 4x4 и вычислите Attention Score для двух векторов. Осознайте, что обучение BERT — это, по сути, обучение этих трех матриц, чтобы они «научились» находить правильные смысловые связи в языке.


3. Магия маскирования: Masked Language Modeling (MLM)

Введение: Главная инновация BERT, которая позволила ему вырваться из оков однонаправленности, — это задача Masked Language Modeling (MLM). В классических моделях, таких как OpenAI Transformer, предсказание следующего слова (Next Token Prediction) вынуждает модель обучаться строго слева направо. Если модель видит «A B C D», она пытается угадать «E», игнорируя всё, что могло бы быть справа. Янник Килчер в видео объясняет, что BERT меняет этот подход: мы случайным образом «закрываем» (маскируем) часть слов в предложении и заставляем модель восстановить их. В примере «The man went to [MASK] store», модель должна задействовать контекст обоих направлений: слово «man» (субъект), «went» (действие) и «store» (объект) вместе формируют семантическую картину, позволяющую с высокой точностью предсказать пропущенное слово «grocery» или «department». Это превращает процесс обучения в глубокий анализ связей, а не просто в статистическое угадывание следующего элемента последовательности.

Примеры из видео: Янник иллюстрирует это на примере предложения «The man went to mask store». Модель не просто видит отдельные слова, она «видит» всё предложение целиком. В отличие от LSTMs, которые «слепы» к будущему, BERT на каждом слое трансформера пропускает данные через головы внимания (Attention Heads), которые позволяют токену «[MASK]» «смотреть» как на «man», так и на «store» одновременно. Спикер подчеркивает, что эта задача требует от модели понимания грамматических и семантических зависимостей, которые невозможно выучить, если видеть текст только в одном направлении. Например, чтобы понять, какой тип магазина подходит под контекст, модель должна соотнести «man» (одушевленный субъект) и «went» (движение), что делает обучение невероятно эффективным для накопления знаний о языке.

Цитата: «And the model simply asked to predict what's here... so it needs to incorporate information from the right and from the left to do this. So that's basically how you train it; they simply drop out some of the words some of the time and they have different techniques... there's several ways of biasing this model but basically you do this masked language modeling.»

✅ Сделайте сейчас: Попробуйте поиграть с концепцией маскирования. Возьмите 5 предложений, в которых смысл ключевого слова критически зависит от окружения (например, «Ключ от [MASK] лежал на столе» vs «Ключ от [MASK] застрял в замке»). Попробуйте вручную «замаскировать» слова и оцените, насколько сложно восстановить смысл, если читать только слева, и насколько легко — при наличии всей фразы. Это упражнение поможет вам прочувствовать, почему двунаправленный контекст BERT критически важен для разрешения лексической многозначности.

4. Дискурсивная глубина: Next Sentence Prediction (NSP)

Введение: Одной из самых интересных находок авторов BERT является задача Next Sentence Prediction (NSP). Хотя MLM отлично справляется с пониманием отдельных слов, многие задачи NLP, такие как вопросно-ответные системы (Q&A) или логический вывод (NLI), требуют понимания связей между целыми предложениями. Янник Килчер объясняет: чтобы обучить модель улавливать дискурс, исследователи создали простую, но гениальную задачу. Они берут два предложения и спрашивают модель: «Является ли второе предложение логическим продолжением первого?». В 50% случаев они берут реальные последовательные предложения из корпуса, а в других 50% — случайно выбранные из разных контекстов. Это заставляет BERT выстраивать внутреннее представление о том, как одна мысль перетекает в другую.

Примеры из видео: Спикер приводит пример, где пара «The man went to the store» и «Penguin are flightless birds» маркируется как «не следующая». Это кажется тривиальным, но для модели это глубокая проверка логических отношений. Входной поток BERT специально адаптирован под это: перед первым предложением ставится токен [CLS], а между предложениями — токен [SEP]. [CLS] по сути становится «агрегатором» всего смысла пары предложений. Янник отмечает, что если убрать NSP из процесса обучения, производительность модели на задачах, требующих логического вывода (как MNLI — Multi-Genre Natural Language Inference), заметно падает. Это доказывает, что архитектура BERT не просто «зазубривает» слова, а учит структуру связного текста, что делает её незаменимой в задачах, где требуется понимание длинных контекстов и логической связности текста, а не просто поиск ключевых слов.

Цитата: «Because they also want to evaluate on let's say entire sequence tasks or tasks that span multiple sentences what they do is the second pre-training task... they feed two sentences... and they ask the model to predict a label is next. And is next is true if the second sentence follows the first and so it's if it's like a logical continuation.»

✅ Сделайте сейчас: Возьмите статью из новостей и разбейте её на пары предложений. Перемешайте их так, чтобы 50% пар были нелогичными (из разных абзацев). Попробуйте определить, как бы вы обучали классификатор «Is Next», опираясь только на первые 10 слов каждого предложения. Поймите, что BERT делает это на уровне глубоких семантических векторов, позволяя улавливать даже самые тонкие намёки на логическую связь, такие как местоименные отсылки или временные маркеры.


5. Оптимизация токенизации через WordPiece

Введение: Одна из фундаментальных проблем в NLP, которую эффективно решает BERT, — это токенизация. Традиционные подходы метались между двумя крайностями: пословной токенизацией (где вы сталкиваетесь с проблемой «out-of-vocabulary» или OOV) и посимвольной (где векторы теряют семантическую плотность). Янник Килчер подчеркивает, что BERT использует алгоритм WordPiece. Суть этого метода заключается в разбиении редких и сложных слов на значимые подсловесные единицы (субтокены). Представьте, что модель встречает редкое имя или неологизм — вместо того чтобы присвоить ему безликий токен [UNK], BERT разбивает его на морфемы, которые он уже «видел» в процессе обучения. Это позволяет модели сохранять смысл слова, даже если она сталкивается с ним впервые, так как она опирается на знакомые «кирпичики» — корни, суффиксы и префиксы.

Примеры из видео: Янник приводит яркий пример с названием канала «PewDiePie». Для стандартной модели это была бы «неизвестная сущность». Однако WordPiece разбивает его на части, которые могут быть семантически нагружены или просто известны по корпусу. То же самое касается слов типа «playing». Модель разбивает его на «play» + «##ing». Токен «##» — это системный маркер, указывающий, что данная часть является продолжением предыдущего токена. Янник поясняет, что это не просто техническое решение, а интеллектуальный компромисс. Модель обучается оперировать наиболее частотными сегментами языка. В результате, модель не страдает от «взрыва» словаря, так как фиксированный размер словаря (например, 30 000 токенов) охватывает почти все возможные комбинации, превращая даже незнакомые слова в понятные последовательности подтокенов. Это кардинально повышает робастность BERT в реальных задачах, где пользовательский текст полон опечаток, сленга и специфических терминов.

Цитата: «The solution is to go in between, say well let's actually go for word pieces... it's really an interpolation between the token model and the character model and it's really neat and it usually works quite well.»

✅ Сделайте сейчас: Поэкспериментируйте с токенизатором BERT (используя библиотеку transformers от Hugging Face). Возьмите сложное или редкое слово (например, «антиконституционность» или «деинсталляция») и проследите, как BertTokenizer разбивает его на субтокены. Обратите внимание на префикс «##». Поймите, что именно эта гибкость позволяет модели работать с любым текстом без необходимости дообучения словаря под каждый новый проект.

6. Архитектурный «пирог»: Входные эмбеддинги BERT

Введение: BERT — это не просто трансформер, это сложная многоуровневая структура, которая «собирает» смысл из трех разных источников данных. Янник Килчер объясняет, что входной вектор для каждого токена — это сумма трех различных эмбеддингов. Во-первых, это сами Token Embeddings, которые переводят индексы слов в векторное пространство. Во-вторых, это Segment Embeddings (сегментные эмбеддинги), которые критически важны для понимания структуры пары предложений: они сообщают модели, принадлежит ли токен к «первому» или «второму» предложению. В-третьих, это Position Embeddings. Поскольку трансформер, в отличие от RNN, обрабатывает весь текст параллельно, ему необходимо «объяснить» порядок слов. Эти эмбеддинги кодируют информацию о том, где именно в предложении находится токен, позволяя модели улавливать контекстную близость, даже когда слова находятся на расстоянии друг от друга.

Примеры из видео: Янник акцентирует внимание на важности специальных токенов [CLS] и [SEP]. Токен [CLS] (Classification) стоит в самом начале последовательности и выступает в роли «агрегатора» смысла всего предложения. В задачах классификации именно вектор этого токена на выходе из последнего слоя используется для принятия решения. [SEP] — это разделитель, который сигнализирует модели о смене логического блока. Спикер отмечает, что без этой жесткой разметки сегментов трансформеру было бы крайне трудно различать, где заканчивается вопрос и начинается контекст в задачах Q&A (как в наборе данных SQuAD). Каждый из этих эмбеддингов — это обучаемый параметр. В процессе предобучения модель учится не только «смыслу» слов, но и «геометрии» структуры предложения, что делает её невероятно глубоким анализатором текста, способным различать структуру даже в очень длинных и запутанных абзацах.

Цитата: «It's kind of hard to learn for a transformer architecture that the tokens kind of separate the sentences... so you can want to help it. And the last thing is positional embeddings... to decide if two tokens are close to each other in input infer if they're right they're just neighbors.»

✅ Сделайте сейчас: Нарисуйте на бумаге (или в цифровом редакторе) схему того, как из строки «BERT — это круто. Он умный.» формируется входной тензор. Обозначьте, какие индексы получат токены [CLS] и [SEP], и как будут выглядеть сегментные эмбеддинги для каждого слова. Осознайте, что обучение BERT — это синхронная настройка всех этих слоев, чтобы они работали как единый механизм для извлечения смысловых паттернов из сырого текста.


7. Fine-tuning: От предобучения к решению задач

Введение: Предобучение BERT — это лишь половина дела. Настоящая магия происходит на этапе fine-tuning (дообучения), когда колоссальные знания модели, накопленные на терабайтах Википедии и книг, адаптируются под конкретную бизнес-задачу. Янник Килчер подчеркивает, что архитектура BERT позволяет решать практически любые задачи NLP (классификация, NER, Q&A) путем добавления «тонкой» надстройки — классификационного слоя. Это делает модель невероятно эффективной: вам не нужно учить всю архитектуру с нуля, достаточно настроить веса выходного слоя и слегка «подправить» параметры самой модели. Это радикально снижает требования к объему размеченных данных, так как модель уже обладает глубоким пониманием языка.

Примеры из видео: Янник подробно разбирает, как BERT справляется с задачами разного типа. Например, в задаче классификации (как MNLI) мы берем вектор токена [CLS] и подаем его в полносвязный слой. В задаче Q&A (SQuAD), где нужно найти ответ в тексте, BERT выдает векторы для каждого токена, и мы обучаем модель предсказывать два индекса: начало и конец «ответа». В Named Entity Recognition (NER) модель классифицирует каждый токен как часть сущности или «пустой» токен. Спикер отмечает, что даже при добавлении этих слоев обучение происходит быстро, а точность модели часто превышает все предыдущие state-of-the-art подходы. Это означает, что для инженера главное — правильно подготовить формат входных данных, а модель сама «найдет» нужные зависимости внутри вашего текста.

Цитата: «The easiest tasks are the so-called sequence level tasks where you basically have the sequence and you're about to predict one class label for the entire sequence... it's really neat because you can be very quick at learning new tasks because you simply start from the pre-trained BERT and then you go and learn a single classification layer on top.»

✅ Сделайте сейчас: Попробуйте выбрать задачу классификации текстов (например, классификация отзывов на позитивные/негативные). Используйте библиотеку transformers и AutoModelForSequenceClassification. Загрузите предобученную модель bert-base-uncased и дообучите её на 500 примерах. Зафиксируйте время обучения и точность (accuracy). Вы удивитесь, насколько качественный результат можно получить, практически не затрагивая веса основной модели, просто обучая «голову» классификатора.

8. Эффективность и значимость абляционных исследований

Введение: Одна из самых ценных частей научной работы — это «абляционные исследования» (ablation studies). Янник Килчер хвалит авторов за то, что они не просто представили «черный ящик», который работает лучше всех, а провели честный анализ того, какие именно компоненты BERT вносят наибольший вклад в результат. Без понимания «почему» это работает, индустрия была бы обречена на бездумное копирование архитектур. Исследователи пошагово отключали NSP и двунаправленность, чтобы доказать: успех BERT не в количестве параметров (хотя это важно), а в фундаментальной способности учитывать контекст с обеих сторон.

Примеры из видео: Спикер приводит график, на котором отчетливо видно, как падает точность модели при отключении NSP или при переходе на однонаправленное обучение. «Если убрать NSP, показатели проседают, если сделать модель однонаправленной, проседают еще сильнее», — поясняет Янник. Это доказывает, что каждая часть «пирога» BERT (MLM + NSP + Attention) не случайна. Это не просто попытка «выжать» из данных максимум, а архитектурная синергия. Янник делает важный вывод: если вы проектируете свою модель, не пытайтесь усложнять её без необходимости. Проведите абляцию, чтобы понять, какой блок реально дает прирост, а какой только потребляет вычислительные ресурсы.

Цитата: «There really seems to be real value in doing this kind of left and right context attention... it's not just about the model size and the amount of data that's basically what they show here and this is really cool.»

✅ Сделайте сейчас: Представьте, что вы хотите создать свою модель для специфического языка (например, редкого диалекта). Опираясь на опыт авторов BERT, составьте план эксперимента: какие части архитектуры вы будете тестировать в первую очередь? Напишите чек-лист: 1) Базовая модель (только MLM), 2) Добавление NSP, 3) Увеличение количества слоев. Поймите, что последовательное усложнение — это единственный способ избежать переобучения и понять истинный потенциал вашей нейросети.

🏋️ Практикум

  1. Анализ токенизации: Напишите функцию, которая разбивает 5 сложных юридических терминов с помощью WordPiece и выводит все субтокены с их идентификаторами.
  2. Сравнение классификаторов: Обучите два классификатора на одной задаче: один с использованием BERT [CLS], второй — усредняя векторы всех токенов предложения. Сравните F1-score.
  3. NSP-тест: Создайте датасет из 20 пар предложений (10 логических, 10 случайных). Проверьте, как предобученная модель BERT (без дообучения) оценивает вероятность «Is Next» для этих пар.
  4. Визуализация внимания: Используйте библиотеку bertviz, чтобы визуализировать веса внимания для слова «кран» в предложениях «Подъемный кран строит дом» и «Водопроводный кран протекает».
  5. Эксперимент с маской: Замаскируйте разные части речи в предложении (существительное, глагол, предлог). Проверьте, что BERT восстанавливает лучше и почему.
  6. Оптимизация инференса: Замерьте время инференса модели на CPU и GPU. Оцените, насколько критично использовать квантование (например, FP16) для ускорения в проде.

🏋️ Практикум

0 / 4 выполнено

Анализ внимания на примере предложения

⏱ 20 мин 🎯 Цель: Понять механизм взаимодействия Query-Key. Шаги: 1. Возьмите предложение из 5 слов. 2. Создайте векторы Q, K, V для каждого токена. 3. Рассчитайте веса внимания через softmax(QK^T). ✅ Результат: Матрица весов внимания, демонстрирующая связи между словами.

Проектирование WordPiece словаря

⏱ 15 мин 🎯 Цель: Оптимизация токенизации. Шаги: 1. Выберите 5 сложных слов (например, 'PewDiePie'). 2. Разбейте их на части, используя логику WordPiece. 3. Проверьте, есть ли части в базовом словаре. ✅ Результат: Список токенов для сложного слова.

План дообучения BERT для классификации

⏱ 25 мин 🎯 Цель: Спроектировать архитектуру fine-tuning'а. Шаги: 1. Определите входную структуру (CLS + Sentence A + SEP + Sentence B). 2. Укажите размерность выходного слоя. 3. Опишите процесс заморозки весов BERT. ✅ Результат: Схема сети (архитектурный чертеж).

Сравнение архитектур (Таблица)

⏱ 10 мин 🎯 Цель: Систематизация знаний. Шаги: 1. Составьте таблицу сравнения GPT, ELMo и BERT. 2. Сравните по критериям: направление контекста, метод обучения, применение. ✅ Результат: Сравнительная таблица в Markdown.
🎉
Все задания выполнены!
Отлично — знания превращены в навыки

💬 Цитаты (3)

«BERT — это модель, которая берет на вход последовательности подтокенов и выдает разнообразные результаты. Ее можно настроить для почти любой NLP-задачи с минимальным обучением, так как модель поставляется уже предобученной на огромном корпусе данных.» #

Обоснование ценности предобученных моделей для снижения порога входа в NLP.

«Основная идея BERT заключается в том, что на каждом слое трансформера для конкретного токена модель смотрит на весь контекст, то есть на каждый другой токен во входной последовательности.» #

Объяснение ключевого преимущества BERT перед однонаправленными моделями.

«Мы используем WordPiece, чтобы интерполировать между посимвольным уровнем и уровнем слов. Это позволяет эффективно обрабатывать редкие слова и имена, разделяя их на значимые составляющие.» #

Обоснование выбора токенизатора для работы с естественным языком.

Похожие по теме

Читать далее

Масштабирование математического мышления LLM: Как обучать модели с помощью GRPO и синтеза данных

Yannic Kilcher

Масштабирование математического мышления LLM: Как обучать модели с помощью GRPO и синтеза данных

Yannic Kilcher

Понравился экстракт?
Подписывайтесь — лучшие материалы каждую неделю.
Telegram Дайджест →

Поделитесь с коллегами

Telegram ВКонтакте X / Twitter
Открыть в Telegram

Экстракт Знаний в Telegram

Экстракты и дистилляты из лучших YouTube-каналов — сразу после публикации.

Подписаться

Дайджест Экстрактов

Лучшие методички за неделю — каждый понедельник