Миш, завтра показываем первую версию. Как докажем, что выдача стала лучше?






Разберите покупки «Полянки», настройте честную валидацию и соберите четыре baseline на реальном датасете. Первый модуль открыт бесплатно.
Начать обучениеВо время учёбы вы соберёте набор из инструментов и алгоритмов под свои рабочие задачи, научитесь ими управлять и станете незаменимым профессионалом
Каждый модуль — новая глава истории. Вы учитесь через сюжет, а не через скучные лекции.
7 модулей. Последовательное погружение — каждый опирается на предыдущий.
Первый день стажёра в Полянке: продуктовый контекст, EDA, валидация во времени, первые метрики и Pop-baseline для главной.
Главная работает, но карточки и корзина пустуют. ALS, iALS, Recall/Precision, popular bias, воронка CTR → AtC → checkout. Эмбеддинги как мост к нейросетям.
Главная ОК, а карточка товара продаёт плохо. KNN-семейство, TIFU-kNN, EASE / ELSA, EASE на корзинах, cold-start, Coverage / Novelty / NDCG, GMV по поверхностям, mixer в онлайне.
Каталог Поляны вырос, EASE/ALS не справляются. A/B-инфра, DSSM с random neg sampling, провал Кости в A/B как кульминация. SASRec, BERT4Rec, sequential two-tower retrieval.
Из sequential two-tower выжимаем рост. In-batch + logQ, temperature, hard negatives. Светлана и БАДы — explainability как требование. eSASRec, DeBERTa4Rec, drift-monitoring.
Двухэтапный пайплайн. Признаки для ранкера, LightGBM и CatBoost ranker, DCNv2. Multi-objective (CTR vs GMV vs retention), position-bias correction, business rules, dedup.
Эпилог. Куда движется индустрия: Semantic IDs (Residual K-Means + Qwen embeddings), ARGUS, HSTU. AlBERT4Rec и другие efficient-архитектуры. Что читать дальше.