Как стать Data Scientist: путь от нуля до первого оффера
Не «стань разработчиком за 3 месяца» — реальный путь входа на основе данных по 168 вакансий.
Можно ли стать Data Scientist с нуля
Да. По данным SkillStat, 7% вакансий Data Scientist — уровня junior или стажёр. Это 12 вакансий прямо сейчас.
«С нуля» для Data Scientist — это без коммерческого опыта, но не без статистики. Дверь открывают три вещи: Python и SQL как рабочие инструменты, чувство выборки и ошибки, и два-три законченных исследования, где видно вопрос, baseline, метрику и границы вывода. Библиотеку можно освоить за неделю. Привычку не доверять первой красивой метрике — нет.
Трудность входа не в объёме теории. Здесь платят за вывод, а не за запуск модели: надо объяснить, какое решение изменится после результата и какой ценой обходится ошибка. На одну junior-вакансию Data Scientist приходится 5.1 senior-вакансии, доминирует middle. Команды берут того, кто сам найдёт утечку будущего в своей выборке и честно скажет, где модель не работает.
Как стать Data Scientist: короткий план
Пять шагов от первого вопроса к данным до вывода, который можно защитить.
Что учить Data Scientist первым
Не всё сразу. Вот очерёдность по частотности в вакансиях — от самого нужного к менее срочному.
| Навык | Все вакансии |
|---|---|
| Python | 91.7% |
| SQL | 63.7% |
| pandas | 42.9% |
| PyTorch | 41.1% |
| LLM | 41.1% |
| NumPy | 34.5% |
| Apache Spark | 31.5% |
| scikit-learn | 31.5% |
| Git | 27.4% |
| RAG | 26.2% |
«Все вакансии» — доля из 168 вакансий. Обновлено 12 августа 2026.
Полный список навыков с частотностью, связками и зарплатной премией — навыки Data Scientist →
Roadmap Data Scientist: от нуля до junior
Порядок опирается на частотность навыков по данным вакансий. Первые 4–5 этапов — минимум для первого оффера.
- 01Python и базовые библиотеки 91.7% вакансий
NumPy, Pandas — обработка данных; Jupyter/VS Code, виртуальные окружения.
Подробнее → - 02Классический ML 31.5% вакансий
Scikit-learn: линейные модели, деревья, градиентный бустинг, оценка качества моделей.
Подробнее → - 03Нейросетевые фреймворки 41.1% вакансий
PyTorch или TensorFlow/Keras — архитектуры, обучение, инференс.
Подробнее → - 04LLM и языковые модели 41.1% вакансий
Трансформеры, API OpenAI/YandexGPT/GigaChat, prompt engineering, few-shot learning.
Подробнее → - 05RAG и векторные базы данных 26.2% вакансий
Retrieval-Augmented Generation: эмбеддинги, Qdrant/Chroma/Weaviate, similarity search.
Подробнее → - 06Агентные фреймворки и оркестрация 20.8% вакансий middle+
LangChain, LlamaIndex — AI-пайплайны, tool calling, многоагентные системы.
Подробнее → - 07Деплой и сервинг моделей 20.8% вакансий middle+
FastAPI/gRPC для инференса, Docker, ONNX — оптимизация latency в production.
Подробнее → - 08MLOps и мониторинг 19.6% вакансий middle+
MLflow, DVC, Airflow — версионирование экспериментов, воспроизводимость, мониторинг дрейфа.
Подробнее →
Junior-вакансии Data Scientist: что реально требуют работодатели
Срез построен на 168 активных вакансий.
Какие проекты сделать для портфолио
Ноутбук с моделью — это не проект. Проект — это ответ на вопрос: что спрашивали, откуда данные, с чем сравнивали, где модель ошибается и чему верить нельзя.
Как оформить GitHub и резюме
- Pinned: два-три исследования, а не десять учебных ноутбуков
- README начинается с вопроса и вывода, а не со списка библиотек
- В каждом кейсе раздел «Ограничения»: где выборка смещена и чему верить нельзя
- Ноутбук воспроизводится сверху вниз: фиксированный seed, версия данных, порядок ячеек
- Метрика указана рядом с baseline — число без точки отсчёта не значит ничего
- Раздел «Исследования» вместо «Опыт работы»: вопрос → данные → метрика → вывод
- Пиши, что изменилось в решении, а не какие модели перебрал
- Называй метрику вместе с разбиением: «recall 0.61 на временном split против 0.44 у правила»
- Статистика — отдельной строкой: гипотезы, доверительный интервал, A/B. Это ядро роли, а не бонус
- Навыки — Python, SQL, и только те, что видны в кейсах
«Изучил машинное обучение, работал с моделями классификации и регрессии, знаком с нейросетями»
«Прогноз оттока по 18 месяцам истории: baseline — правило по давности покупки, CatBoost поднял recall с 0.44 до 0.61 на временном split. Нашёл и убрал две утечки будущего, описал сегменты, где модель неприменима. GitHub: [ссылка]»
Самостоятельно, курсы или вуз — какой путь выбрать
Курсы для Data Scientist
Сопоставили программы с реальным стеком из 168 вакансий — оценка соответствия рассчитана автоматически, это не реклама.
Когда начинать искать первую работу
Есть два исследования, где ты объясняешь выбор метрики, показываешь baseline и называешь условия недоверия к выводу, — откликайся. Второй признак готовности: можешь за пять минут рассказать, где в твоём проекте могла быть утечка и как ты её проверял.
- → hh.ru — фильтр junior и стажировка; смотри вакансии команд данных, а не только точное название роли
- → Habr Career — разделы данных и машинного обучения
- → Стажировки в компаниях с большими данными: Яндекс, VK, Т-Банк, Ozon, Сбер — у них отдельные наборы в исследовательские команды
- → Соревнования и открытые датасеты — это не работа, но источник кейсов и контактов
- → Telegram-каналы вакансий по данным и машинному обучению
- → Смотри на задачу, а не на список библиотек: скоринг, рекомендации, прогноз спроса, тексты и изображения требуют разного
- → «Опыт с PyTorch» в вакансии с табличными данными — чаще пожелание, чем условие
- → Если в описании нет ни метрики, ни гипотезы, ни эксперимента — там ждут отчётность, а не исследование
- → «Знание статистики» — единственное требование, которое почти никогда не бывает желательным
- → Совпадает большая часть требований — откликайся: недостающая библиотека учится по ходу, метод — нет
Что спрашивают на собеседовании
Статистика и эксперимент
- ·Что такое доверительный интервал простыми словами
- ·Как выбрать размер выборки для A/B
- ·Ошибки первого и второго рода — на примере твоей задачи
- ·Почему p-value не вероятность гипотезы
Кейс с A/B: гипотеза, метрика, размер выборки, вывод
Валидация и leakage
- ·Откуда берётся утечка будущего
- ·Почему случайное разбиение ломается на временных данных
- ·Когда cross-validation врёт
- ·Метрика на тесте выше, чем на валидации — что произошло
Прогноз на временных данных: покажи схему split
Метрики качества
- ·ROC-AUC против precision и recall
- ·Что делать с дисбалансом классов
- ·MAE или RMSE — как выбрать
- ·Как метрика связана с решением, которое примут по модели
Baseline против бустинга: одна метрика, одно разбиение
Классический ML и бустинг
- ·Линейная модель против дерева — когда что
- ·Как устроен градиентный бустинг
- ·Признаки переобучения и как их ловить
- ·Зачем нужен baseline, если есть CatBoost
Сравнение моделей с честным замером
SQL и качество данных
- ·Соединения, группировки и оконные функции
- ·Как найти дубли и разрывы во временном ряду
- ·Что проверяешь в выборке до первой модели
- ·Откуда берётся смещение выборки
Витрина признаков: покажи запросы и проверки
LLM и RAG
- ·Когда RAG оправдан, а когда хватит правила
- ·Как оценивать качество поиска по документам
- ·Как ловить галлюцинации
- ·Что мешает вынести LLM-прототип в решение
RAG-прототип: набор вопросов и замер
Сколько времени нужно, чтобы стать Data Scientist
Почему «за 4 месяца» — маркетинг. За 4 месяца ставятся pandas и scikit-learn. Чувство выборки и умение поймать утечку набираются на разборах чужих ошибок — это календарное время, а не количество уроков.
Быстрее всех заходят те, у кого уже есть матстатистика: аналитики, физики, экономисты, инженеры. Им остаётся прикладной слой. Медленнее всех — те, кто начал с нейросетей и обходит вероятность стороной.
Скорость зависит и от домена: табличные задачи (отток, спрос, скоринг) дают первый оффер раньше, чем тексты и изображения, — там короче путь от кейса до результата.
Ошибки новичков
Начинают с нейросети
Почему мешает: Без baseline нельзя доказать, что сложность дала выигрыш; на табличных данных бустинг чаще обыгрывает PyTorch
Как исправить: Сначала простое правило, потом линейная модель, потом CatBoost или LightGBM. PyTorch — когда задача этого требует
Случайное разбиение на временных данных
Почему мешает: Модель подглядывает в будущее и показывает метрику, которой в реальности не будет
Как исправить: Временной split: обучение до даты, проверка после. Ту же границу держи и внутри признаков
Метрика без связи с решением
Почему мешает: ROC-AUC 0.95 никого не радует, если после результата никто не поменял ни одного действия
Как исправить: До обучения ответь: кого ранжируем, кому звоним, что отключаем. Метрику подбирай под это
Не ищут утечку признаков
Почему мешает: Самая частая причина, по которой модель отлично работает в ноутбуке и разваливается на практике
Как исправить: По каждому признаку спроси: он существовал в момент предсказания? Подозрительно сильные признаки проверяй отдельно
Пропускают SQL
Почему мешает: Данные берут из готового csv, а в работе выборку собираешь сам: SQL — в 63.7% вакансий Data Scientist
Как исправить: Выборки, соединения, группировки, оконные функции и поиск дублей — до первой модели
Ноутбук вместо исследования
Почему мешает: Сорок ячеек без вопроса и вывода читать невозможно, а работодатель читает именно это
Как исправить: README: вопрос, данные, baseline, метрика, ограничения. Ноутбук запускается сверху вниз
Не смотрят на ошибки модели
Почему мешает: Средняя метрика прячет сегменты, где модель врёт систематически и где ошибка стоит дороже всего
Как исправить: Разбор по сегментам, важность признаков, SHAP — и отдельный список случаев недоверия
LLM-демо без оценки
Почему мешает: RAG — в 26.2% вакансий Data Scientist, но прототип без замера поиска и галлюцинаций не отличается от игры с промптами
Как исправить: Собери набор вопросов с эталонными ответами и померяй качество, прежде чем показывать
Как SkillStat считает данные
Источник: 168 вакансий в московском сегменте. Навыки и грейды извлекаются автоматически из текста каждой вакансии.
Грейды: определяются по требованиям вакансии — уровню опыта, упоминанию «junior», «intern», «стажёр». Это рыночная оценка объявления.
Сложность входа: рассчитывается по доле junior-вакансий и медиане навыков на junior-уровне. Это индикатор, а не гарантия.
Обновление: данные пересчитываются регулярно. Текущий срез — 12 августа 2026.