Подготовка к роли в команде базового алайнмента Alice AI LLM: SFT, RLHF/RLVR, reward-модели и объединение экспертных моделей
Фишка: Команда работает на стадии алайнмента Alice AI LLM — превращает предобученную модель в диалогового агента через SFT, RLHF/RLVR (GRPO, GSPO), reward-модели и On-Policy Distillation. Ожидают сочетание классического ML, понимания современных LLM и умения проводить ML-эксперименты.
| Этап | Длительность | Что проверяют |
|---|---|---|
| HR / скрининг | 30–45 мин | Мотивация, опыт с ML/NLP/LLM, формат работы (гибрид/удалёнка/офис), зарплатные ожидания, готовность к исследовательским задачам в продуктовой команде |
| Технический скрининг | 60–90 мин | Классический ML (регуляризация, overfitting, метрики), Python, базовые алгоритмы и асимптотика, понимание трансформеров и NLP |
| Глубокое ML-интервью | 90–120 мин | LLM alignment: SFT, preference learning, reward models, online RL; дизайн экспериментов, оценка качества генерации, trade-offs между стадиями обучения |
| Задачи / кейс | 60–90 мин | Задачи по вероятности, алгоритмам, Python; возможен разбор ML-кейса: как улучшить качество ответов модели или спроектировать пайплайн разметки |
| Финал с командой | 45–60 мин | Fit с командой алайнмента, опыт end-to-end экспериментов, готовность работать на стыке research и production |
Обязательный минимум
Плюсом будет
Что такое overfitting и как с ним бороться?
Переобучение = модель запомнила train, плохо generalize. Методы: train/val split, cross-validation, L1/L2 регуляризация, dropout, early stopping, больше данных, упрощение модели, ансамбли.
Зачем нужен learning rate и что будет при слишком большом/малом значении?
LR задаёт шаг градиентного спуска. Слишком большой — расходимость/осцилляции; слишком маленький — медленная сходимость, застревание. Scheduler (cosine, warmup) и adaptive optimizers (AdamW) помогают.
Какие методы борьбы с переобучением существуют и как они работают?
Регуляризация (L1 sparsity, L2 weight decay), dropout, data augmentation, early stopping, bagging/boosting с контролем глубины, k-fold CV для честной оценки.
В чём разница между L1 и L2 регуляризацией?
L1 (Lasso) — штраф |w|, обнуляет веса → feature selection. L2 (Ridge) — штраф w², сжимает веса равномерно. В нейросетях чаще weight decay ≈ L2.
Как работает градиентный бустинг?
Последовательно добавляем слабые модели (деревья), каждая обучается на residual/negative gradient предыдущего ансамбля. XGBoost — level-wise, LightGBM — leaf-wise (быстрее, риск overfit).
Как оптимально выбрать признак и порог для разбиения в решающих деревьях?
Перебор признаков и порогов, максимизация gain: Gini impurity или information gain (энтропия до − после split). Ограничения: max_depth, min_samples_leaf против overfit.
Какие параметры случайного леса можно менять и как влияют глубина и число деревьев?
n_estimators, max_depth, max_features, min_samples_split/leaf, bootstrap. Больше деревьев → стабильнее (до плато). Глубина ↑ → bias ↓, variance ↑, риск overfit.
Фишка: Яндекс для ML-ролей проверяет фундамент даже в LLM-командах: без уверенного классического ML сложно пройти скрининг.
Ловушка: Не путайте bagging (RF, параллельные деревья) и boosting (последовательные residual). На интервью часто просят объяснить bias-variance trade-off для каждого.
Что такое precision и recall?
Precision = TP/(TP+FP) — точность положительных предсказаний. Recall = TP/(TP+FN) — полнота. Выбор зависит от cost FP vs FN.
Почему F1-score — гармоническое, а не арифметическое среднее precision и recall?
Гармоническое среднее сильнее штрафует дисбаланс: если один из показателей низкий, F1 падает резко. Полезно при imbalanced classes.
Можно ли считать модель с F1=0.81 лучше модели с F1=0.8 и сразу запускать в прод?
Нет автоматически. Проверить: статзначимость, стабильность на holdout/online, latency, bias, регрессии на сегментах, shadow/canary deploy.
Какие метрики используете для оценки качества модели?
Classification: accuracy, precision/recall/F1, ROC-AUC, PR-AUC. Regression: MAE, RMSE, MAPE. LLM: win-rate, rubric scores, human eval, LLM-as-Judge (с калибровкой).
Какая алгоритмическая сложность вычисления ROC-AUC?
O(n log n) из-за сортировки scores; затем один проход по отсортированным парам для подсчёта TPR/FPR.
Что важнее — precision или recall для отправки объявления на ручную модерацию?
Обычно precision: лишняя ручная проверка дороже, чем пропуск (recall). Но зависит от cost matrix бизнеса.
Совет: Для alignment-команды уметь переводить offline-метрики (win-rate, rubric) в продуктовые решения так же важно, как знать F1.
Ловушка: Accuracy бесполезна при дисбалансе классов — всегда аргументируйте выбор метрики задачей.
Можно ли изменять строку в Python?
str — immutable. «Изменение» создаёт новый объект. Для mutable string-like — bytearray или list of chars.
Какие неизменяемые и изменяемые типы данных знаете в Python?
Immutable: int, float, str, tuple, frozenset. Mutable: list, dict, set, bytearray.
В чём разница между copy и deepcopy?
copy — shallow: вложенные объекты по ссылке. deepcopy — рекурсивная копия всего графа объектов.
Какая сложность сортировки списка?
Timsort в Python: O(n log n) worst/average. Лучший случай O(n) при почти отсorted данных.
Какова асимптотика при нескольких проходах по списку?
k проходов → O(k·n). Константу не схлопывают в O(n), если k зависит от n.
Могут ли на ML-интервью давать задачи по структурам данных (деревья, linked list)?
Да, особенно в Яндексе — базовые DS задачи возможны. Понимать when/why: heaps для top-k, hash map для O(1) lookup, trees для sorted data.
Фишка: Внутренняя база Эйч фиксирует вопросы по Python и асимптотике как типичные для собесов в Яндекс на ML-позиции.
Какие методы оценки сходства векторов в NLP знаете?
Cosine similarity, dot product (при нормализованных), Euclidean. Для sparse — BM25; для dense — cosine/FAISS/ANN.
Какое свойство cosine similarity делает его предпочтительным для поиска ближайших соседей?
Инвариантность к длине вектора — измеряет угол, а не масштаб. Удобно для text embeddings разной нормы.
Как быстро отранжировать векторы по близости к запросу?
Exact: матричное умножение + top-k (heap). Approximate: FAISS, HNSW, IVF — trade-off recall vs speed.
Совет: Cosine similarity часто используется при retrieval для RAG и при оценке semantic similarity в reward pipelines.
Как устроен transformer и механизм self-attention?
Q,K,V projections → softmax(QK^T/√d)V. Multi-head — параллельные attention heads. Positional encoding добавляет порядок токенов.
Чем pretraining отличается от SFT и alignment?
Pretrain — next-token prediction на большом корпусе. SFT — supervised demos/instructions. Alignment — preference/RL/reward для поведения и безопасности.
Какие проблемы возникают при fine-tuning больших LLM?
Catastrophic forgetting, overfit на малый SFT, hallucinations, distribution shift, compute/memory → LoRA, QLoRA, careful lr.
Что такое instruction following и как его измерить?
Модель выполняет формат/ограничения промпта. Метрики: rubric compliance, format accuracy, human/LLM judge win-rate на instruction-heavy бенчмарках.
Фишка: Вакансия прямо требует понимания, как pretrain-LLM превращается в диалогового агента — это центральная тема интервью.
Как выбираете, какие задачи включать в SFT-датасет?
Coverage user intents, gap analysis (где модель fails), difficulty curriculum, diversity, quality filters, баланс доменов.
Как определить, каких навыков не хватает модели для конкретной задачи?
Error analysis на eval set, clustering failures, сравнение с stronger model/human, ablation по skill categories.
Как оценить качество SFT без немедленного RL?
Held-out prompts, automatic metrics (BLEU/ROUGE ограничены), LLM judge, human spot-check, per-skill breakdown.
Какие trade-offs при увеличении сложности демонстраций в SFT?
Лучше ceiling vs риск noise, longer context, slower training, возможный conflict с simpler behaviors.
Совет: Готовьте пример структуры эксперимента: гипотеза → subset данных → метрика → результат → decision.
Ловушка: SFT не заменяет alignment: модель может хорошо имитировать формат, но плохо ранжировать качество ответов.
Опишите pipeline RLHF для LLM
SFT → collect pairwise preferences → train reward model → RL (PPO) с KL penalty к reference model. Альтернатива: DPO без явного RM.
Чем RLHF отличается от RLVR (verifiable rewards)?
RLHF — human preferences (subjective). RLVR — автоматические проверяемые награды (code tests, math answer, tool result). RLVR дешевле и масштабируемее где reward objective.
Что такое GRPO и GSPO в контексте online RL для LLM?
Group Relative Policy Optimization — оптимизация относительно группы sampled responses без critic. GSPO — variant с group sampling policy optimization. Online = policy генерирует on-the-fly, reward в реальном времени.
Зачем KL-penalty при RL fine-tuning LLM?
Удерживает policy близко к reference (SFT), предотвращает mode collapse, reward hacking, деградацию fluency.
Как обучать с учётом нескольких аспектов качества одновременно?
Multi-objective reward (weighted sum), Pareto front, staged training, separate reward heads, constraint RL.
Фишка: Команда явно использует GRPO, GSPO и комбинацию RLHF + RLVR — это must-know для финального интервью.
Ловушка: Reward hacking: модель оптимизирует proxy metric, а не реальное качество. Всегда упоминайте eval на human/verifiable checks.
Как обучить reward model на pairwise comparisons?
Bradley-Terry / logistic loss: P(y_w > y_l) = σ(r(x,y_w) − r(x,y_l)). Train RM to predict human preferences.
Почему human labeling дорого и как это обойти?
Active learning, rubric-based auto scoring, LLM-as-a-Judge с calibration, distillation RM, semi-synthetic prefs.
Что такое LLM-as-a-Judge и его ограничения?
Strong LLM оценивает ответы по rubric. Риски: bias к verbose/self-similar, position bias, нужна калибровка на human gold.
Как использовать rubric-based оценки в reward pipeline?
Декомпозиция качества (helpfulness, safety, format) → partial scores → aggregate reward. Улучшает interpretability и multi-objective.
Совет: Online RL требует быстрой reward inference — обсудите latency RM vs batch human eval.
Что такое On-Policy Distillation (OPD)?
Student генерирует свои outputs (on-policy), teacher оценивает/даёт soft targets на этих trajectories — лучше match реального distribution student.
Как объединить экспертные модели разных доменов в одну?
Model merging (weighted average, SLERP), multi-task SFT, routing/MoE, sequential distillation from experts, continue SFT on mixed data.
Какие риски при merge expert models?
Interference между weights, forgetting, inconsistent behaviors, нужен eval per domain + holistic.
Фишка: OPD упомянут в описании вакансии — покажите понимание off-policy vs on-policy distillation.
Чему равна максимальная вероятность вытащить белый шар из случайно выбранной корзины?
Классическая задача: максимизировать P по выбору распределения между корзинами. Решение через анализ worst/best case или метод Lagrange — покажите систематический подход.
Почему при обучении на положительных таргетах модель может предсказывать отрицательные значения?
kNN/линейная регрессия/NN экстраполируют за пределы train. Деревья — piecewise constant. Бустинг — сумма residuals может уйти ниже min(y).
Можно ли считать новую модель лучше по +0.01 F1 без дополнительных проверок?
Нужны confidence intervals, проверка на разных срезах, online metrics, cost of errors.
Ловушка: На задачах по вероятности в Яндексе важна не только формула, но и объяснение интуиции и edge cases.
Максимум вероятности белого шара
Есть несколько корзин с белыми и чёрными шарами. Сначала случайно выбирается корзина (равновероятно), затем из неё случайно достаётся шар. Как распределить шары между корзинами, чтобы максимизировать вероятность достать белый шар?
Пусть корзин k, в i-й корзине b_i белых и c_i чёрных. P(белый) = (1/k) Σ b_i/(b_i+c_i). Для максимума часто оптимально: одну корзину сделать «гарантированно белой» (все белые туда), остальные — с минимальной долей белых или пустые чёрные. Конкретный ответ зависит от числа шаров — на интервью важно: (1) записать формулу, (2) рассмотреть крайние стратегии, (3) обосновать почему смешанная стратегия не лучше.
Сложность: O(k) для вычисления вероятности при фиксированном распределении
Pairwise preference accuracy
Дан список пар ответов (A, B) и метки предпочтения (A лучше / B лучше / tie). Напишите функцию, которая по scores от reward model для A и B считает accuracy согласованности с human labels.
def pref_accuracy(pairs, scores, labels):
correct = 0
for (a, b), label, (sa, sb) in zip(pairs, labels, scores):
pred = 0 if abs(sa - sb) < eps else (1 if sa > sb else -1)
if label == 'tie' and abs(sa - sb) < eps: correct += 1
elif label == 'A' and sa > sb: correct += 1
elif label == 'B' and sb > sa: correct += 1
return correct / len(pairs)Сложность: O(n)
Top-k ближайших эмбеддингов
Дан query vector q и matrix embeddings E shape (N, d). Верните индексы k документов с наибольшим cosine similarity к q.
import numpy as np
def topk_cosine(q, E, k):
qn = q / (np.linalg.norm(q) + 1e-9)
En = E / (np.linalg.norm(E, axis=1, keepdims=True) + 1e-9)
sims = En @ qn
idx = np.argpartition(-sims, k)[:k]
return idx[np.argsort(-sims[idx])]Сложность: O(N·d + N log k) с argpartition
Каркас ответа
3 дня
7 дней
14 дней
| Блок | Готов, если... |
|---|---|
| Классический ML | можешь объяснить overfitting, L1/L2, RF/boosting и выбор гиперпараметров |
| Метрики | можешь выбрать метрику под задачу и аргументировать против blind accuracy |
| Python/алгоритмы | уверенно пишешь top-k, знаешь сложность sort и mutability |
| LLM basics | объясняешь attention, pretrain vs SFT vs alignment |
| SFT | можешь спроектировать eval и curriculum для instruction data |
| RLHF/RLVR | описываешь pipeline, KL-penalty, reward hacking и online RL |
| Reward Modeling | знаешь pairwise training и ограничения LLM-as-Judge |
| System design | можешь набросать end-to-end alignment pipeline с eval и deploy |
В день собеседования