Что могут спросить по теме трансформеров на собеседовании:
Основные типы LLM:
Обучение
Оценка
Как бороться с галлюцинациями в LLM?
Как оптимизируют внимание в трансформерах?
Какие гиперпараметры генерации ключевые в GPT?
Основные типы LLM:
авторегрессионные (ex.GPT) генерируют текст последовательно, предсказывая следующее слово
двунаправленные(ex.BERT) анализируют контекст слева и справа от слова
энкодер-декодер(ex.T5, BART) преобразуют входные данные в выходные через промежуточное представление
Обучение
предобучение на большом корпусе текста с задачами вроде предсказания следующего токена или заполнения масок
fine-tuning на специфических датасетах для конкретных задач
Оценка
perplexity:
(the lower the better)
фактологичность, связность
ну и разные бенчмарки:
(GLUE, SuperGLUE, SQuAD)
Чем BERT отличается от GPT?
BERT: двунаправленный,
masked LM, для классификации
GPT: авторегрессия, генерация текста
Как бороться с галлюцинациями в LLM?
контроль температуры, top-k/p,
проверка фактов, fine-tuning
Как оптимизируют внимание в трансформерах?
разреженное внимание, кэширование, квантование, пакетная обработка
Какие гиперпараметры генерации ключевые в GPT?
temperature:
(креативность)
top-k/p:
(выбор токенов)
beam search:
(качество)
repetition_penalty