Данные из 168вакансий · 12 августа 2026

Как стать Data Scientist: путь от нуля до первого оффера

Не «стань разработчиком за 3 месяца» — реальный путь входа на основе данных по 168 вакансий.

Мурадов ЮрийАвтор·Мурадов Юрий·Аналитик SkillStat
ИАПроверено·Игорь Антонов·Технический редактор·Senior Data Scientist
Junior-вакансий сейчас
12
7% от всех 168 вакансий
Сложность входа
Средняя
7% junior-вакансий
Senior / Junior+Intern
5.1x
На каждого junior+intern — 5.1 senior
Навыков / вакансия
9
медиана по вакансиям
Всего вакансий
168
активных в Москве

Можно ли стать Data Scientist с нуля

Да. По данным SkillStat, 7% вакансий Data Scientist — уровня junior или стажёр. Это 12 вакансий прямо сейчас.

«С нуля» для Data Scientist — это без коммерческого опыта, но не без статистики. Дверь открывают три вещи: Python и SQL как рабочие инструменты, чувство выборки и ошибки, и два-три законченных исследования, где видно вопрос, baseline, метрику и границы вывода. Библиотеку можно освоить за неделю. Привычку не доверять первой красивой метрике — нет.

Трудность входа не в объёме теории. Здесь платят за вывод, а не за запуск модели: надо объяснить, какое решение изменится после результата и какой ценой обходится ошибка. На одну junior-вакансию Data Scientist приходится 5.1 senior-вакансии, доминирует middle. Команды берут того, кто сам найдёт утечку будущего в своей выборке и честно скажет, где модель не работает.

Как стать Data Scientist: короткий план

Пять шагов от первого вопроса к данным до вывода, который можно защитить.

01
Вопрос и выборка
Сначала формулируешь, что предсказываем и какое решение поменяется. Потом достаёшь данные SQL-запросом и проверяешь пропуски, дубли, выбросы и временные границы.
02
Baseline и метрика
Простое правило — точка отсчёта, без неё выигрыш модели недоказуем. Метрику выбирай под действие: ROC-AUC, precision, recall, MAE и RMSE отвечают на разные вопросы.
03
Классические модели
pandas, NumPy, scikit-learn и бустинг: CatBoost, LightGBM (12.5%), XGBoost (13.1%). На табличных задачах они обыгрывают нейросеть чаще, чем принято думать.
04
Валидация и leakage
Разбиение выборки, cross-validation, временной split, разбор по сегментам. Отдельно ищешь признаки, которых в момент предсказания ещё не существовало.
05
Разбор и передача
Feature importance, SHAP, разбор ошибок и список условий, при которых выводу верить нельзя. Без этого исследование не доезжает до решения.

Что учить Data Scientist первым

Не всё сразу. Вот очерёдность по частотности в вакансиях — от самого нужного к менее срочному.

Навык Все вакансии
Python 91.7%
SQL 63.7%
pandas 42.9%
PyTorch 41.1%
LLM 41.1%
NumPy 34.5%
Apache Spark 31.5%
scikit-learn 31.5%
Git 27.4%
RAG 26.2%

«Все вакансии» — доля из 168 вакансий. Обновлено 12 августа 2026.

Полный список навыков с частотностью, связками и зарплатной премией — навыки Data Scientist →

Roadmap Data Scientist: от нуля до junior

Порядок опирается на частотность навыков по данным вакансий. Первые 4–5 этапов — минимум для первого оффера.

  1. 01
    Python и базовые библиотеки 91.7% вакансий

    NumPy, Pandas — обработка данных; Jupyter/VS Code, виртуальные окружения.

    Подробнее →
  2. 02
    Классический ML 31.5% вакансий

    Scikit-learn: линейные модели, деревья, градиентный бустинг, оценка качества моделей.

    Подробнее →
  3. 03
    Нейросетевые фреймворки 41.1% вакансий

    PyTorch или TensorFlow/Keras — архитектуры, обучение, инференс.

    Подробнее →
  4. 04
    LLM и языковые модели 41.1% вакансий

    Трансформеры, API OpenAI/YandexGPT/GigaChat, prompt engineering, few-shot learning.

    Подробнее →
  5. 05
    RAG и векторные базы данных 26.2% вакансий

    Retrieval-Augmented Generation: эмбеддинги, Qdrant/Chroma/Weaviate, similarity search.

    Подробнее →
  6. 06
    Агентные фреймворки и оркестрация 20.8% вакансий middle+

    LangChain, LlamaIndex — AI-пайплайны, tool calling, многоагентные системы.

    Подробнее →
  7. 07
    Деплой и сервинг моделей 20.8% вакансий middle+

    FastAPI/gRPC для инференса, Docker, ONNX — оптимизация latency в production.

    Подробнее →
  8. 08
    MLOps и мониторинг 19.6% вакансий middle+

    MLflow, DVC, Airflow — версионирование экспериментов, воспроизводимость, мониторинг дрейфа.

    Подробнее →

Junior-вакансии Data Scientist: что реально требуют работодатели

Срез построен на 168 активных вакансий.

Junior-вакансий
12
inc. стажировки
Доля junior
7%
от всего рынка
Senior / Junior+Intern
5.1x
соотношение
Навыков / вакансия
9
медиана
Распределение вакансий по грейдам
Intern — 1.4% (2)
Junior — 7.1% (10)
Middle — 35% (49)
Senior — 43.6% (61)
Lead — 12.9% (18)
Что значат эти цифры. 12 из 168 вакансий — уровня junior и стажёра, доминирует middle. Причина не в моде на опытных: цена ошибочного вывода выше цены плохого кода, потому что по модели принимают решения, а не смотрят на неё. Для входа это значит одно: показывай не количество ноутбуков, а одно доведённое исследование с честной валидацией.

Какие проекты сделать для портфолио

Ноутбук с моделью — это не проект. Проект — это ответ на вопрос: что спрашивали, откуда данные, с чем сравнивали, где модель ошибается и чему верить нельзя.

Прогноз на временных данных
Средняя · 2–3 недели
Стек: Python, SQL, pandas, scikit-learn, CatBoost
GitHub: README с вопросом, схемой временного split и разделом «Ограничения»; ноутбук запускается сверху вниз
Ценность: Показывает главное умение роли — не пустить будущее в обучающую выборку
Baseline против бустинга
Лёгкая–средняя · 1–2 недели
Стек: scikit-learn, LightGBM, XGBoost, pandas
GitHub: Таблица сравнения: простое правило, линейная модель, бустинг — на одной метрике и одном разбиении
Ценность: Доказывает, что сложность дала выигрыш, а не просто выглядела умнее
Разбор ошибок модели
Средняя · 1–2 недели
Стек: pandas, NumPy, scikit-learn, SHAP
GitHub: Отчёт по сегментам: где модель врёт, на ком и почему; важность признаков с интерпретацией
Ценность: Тема, на которой junior обычно молчит: число есть, понимания риска нет
RAG-прототип с оценкой
Средняя · 2 недели
Стек: Python, LLM, RAG, LangChain
GitHub: Набор вопросов с эталонными ответами, замер качества поиска и разбор галлюцинаций
Ценность: LLM — в 41.1% вакансий Data Scientist, RAG — в 26.2%; без замера это демо, а не кейс
Витрина признаков
Средняя · 2 недели
Стек: SQL, PostgreSQL, Apache Spark, Apache Airflow
GitHub: Скрипты сборки признаков с фиксацией даты среза и проверками качества
Ценность: Apache Spark — в 31.5% вакансий, Airflow — в 19.6%: видно, что выборку ты собираешь сам

Как оформить GitHub и резюме

Профиль GitHub
  • Pinned: два-три исследования, а не десять учебных ноутбуков
  • README начинается с вопроса и вывода, а не со списка библиотек
  • В каждом кейсе раздел «Ограничения»: где выборка смещена и чему верить нельзя
  • Ноутбук воспроизводится сверху вниз: фиксированный seed, версия данных, порядок ячеек
  • Метрика указана рядом с baseline — число без точки отсчёта не значит ничего
Резюме без коммерческого опыта
  • Раздел «Исследования» вместо «Опыт работы»: вопрос → данные → метрика → вывод
  • Пиши, что изменилось в решении, а не какие модели перебрал
  • Называй метрику вместе с разбиением: «recall 0.61 на временном split против 0.44 у правила»
  • Статистика — отдельной строкой: гипотезы, доверительный интервал, A/B. Это ядро роли, а не бонус
  • Навыки — Python, SQL, и только те, что видны в кейсах
Слабое резюме

«Изучил машинное обучение, работал с моделями классификации и регрессии, знаком с нейросетями»

Сильное резюме

«Прогноз оттока по 18 месяцам истории: baseline — правило по давности покупки, CatBoost поднял recall с 0.44 до 0.61 на временном split. Нашёл и убрал две утечки будущего, описал сегменты, где модель неприменима. GitHub: [ссылка]»

Самостоятельно, курсы или вуз — какой путь выбрать

Самостоятельно
Можно идти от задачи: взял открытые данные, довёл до вывода, повторил на другом домене
Статистику почти все пропускают — без неё исследование рассыпается на первом же вопросе про валидацию
Если готов честно сесть за вероятность и выборку, а не только за библиотеки
Курсы с ментором
Ревью исследования — то, чего нет в самообучении: чужой глаз видит утечку быстрее твоего
Программы часто заканчиваются на «обучили модель» и не трогают выбор метрики, эксперимент и разбор ошибок
Если нужен фидбек по методу, а не по коду; проверяй, есть ли в программе A/B и cross-validation
Вуз / колледж
Матстатистика, теория вероятностей и линейная алгебра даются системно — догонять их потом дороже
Прикладной стек собираешь сам: учебная программа отстаёт от того, что просят в вакансиях
Если целишься в исследовательские команды или сложные модельные направления
Ловушка — гнаться за архитектурой. PyTorch (41.1% вакансий) и LLM (41.1%) выглядят интереснее, чем доверительный интервал, поэтому статистику откладывают на потом. Вскрывается первым же вопросом на собеседовании: почему метрика на тесте выше, чем на валидации, и что ты с этим сделал. Нейросеть без честной проверки — это красивый график и нулевая ценность.
Курсы · подобрано по данным рынка

Курсы для Data Scientist

Сопоставили программы с реальным стеком из 168 вакансий — оценка соответствия рассчитана автоматически, это не реклама.

Все курсы →
Соответствие = доля ключевых навыков вакансий, которые закрывает программа курса. На основе 168 вакансий, обновлено автоматически.

Что спрашивают на собеседовании

Статистика и эксперимент
Типовые вопросы
  • ·Что такое доверительный интервал простыми словами
  • ·Как выбрать размер выборки для A/B
  • ·Ошибки первого и второго рода — на примере твоей задачи
  • ·Почему p-value не вероятность гипотезы
Как показать проектом

Кейс с A/B: гипотеза, метрика, размер выборки, вывод

Валидация и leakage
Типовые вопросы
  • ·Откуда берётся утечка будущего
  • ·Почему случайное разбиение ломается на временных данных
  • ·Когда cross-validation врёт
  • ·Метрика на тесте выше, чем на валидации — что произошло
Как показать проектом

Прогноз на временных данных: покажи схему split

Метрики качества
Типовые вопросы
  • ·ROC-AUC против precision и recall
  • ·Что делать с дисбалансом классов
  • ·MAE или RMSE — как выбрать
  • ·Как метрика связана с решением, которое примут по модели
Как показать проектом

Baseline против бустинга: одна метрика, одно разбиение

Классический ML и бустинг
Типовые вопросы
  • ·Линейная модель против дерева — когда что
  • ·Как устроен градиентный бустинг
  • ·Признаки переобучения и как их ловить
  • ·Зачем нужен baseline, если есть CatBoost
Как показать проектом

Сравнение моделей с честным замером

SQL и качество данных
Типовые вопросы
  • ·Соединения, группировки и оконные функции
  • ·Как найти дубли и разрывы во временном ряду
  • ·Что проверяешь в выборке до первой модели
  • ·Откуда берётся смещение выборки
Как показать проектом

Витрина признаков: покажи запросы и проверки

LLM и RAG
Типовые вопросы
  • ·Когда RAG оправдан, а когда хватит правила
  • ·Как оценивать качество поиска по документам
  • ·Как ловить галлюцинации
  • ·Что мешает вынести LLM-прототип в решение
Как показать проектом

RAG-прототип: набор вопросов и замер

Сколько времени нужно, чтобы стать Data Scientist

Минимум
9–12 мес
С математической базой из вуза и практикой по 4–6 часов в день
Медиана
18–24 мес
Самостоятельно с нуля: статистика, SQL, классический ML, три доведённых кейса
Реалистично
24–30 мес
При совмещении с работой или переходе из смежной роли без матбазы

Почему «за 4 месяца» — маркетинг. За 4 месяца ставятся pandas и scikit-learn. Чувство выборки и умение поймать утечку набираются на разборах чужих ошибок — это календарное время, а не количество уроков.

Быстрее всех заходят те, у кого уже есть матстатистика: аналитики, физики, экономисты, инженеры. Им остаётся прикладной слой. Медленнее всех — те, кто начал с нейросетей и обходит вероятность стороной.

Скорость зависит и от домена: табличные задачи (отток, спрос, скоринг) дают первый оффер раньше, чем тексты и изображения, — там короче путь от кейса до результата.

Ошибки новичков

Начинают с нейросети

Почему мешает: Без baseline нельзя доказать, что сложность дала выигрыш; на табличных данных бустинг чаще обыгрывает PyTorch

Как исправить: Сначала простое правило, потом линейная модель, потом CatBoost или LightGBM. PyTorch — когда задача этого требует

Случайное разбиение на временных данных

Почему мешает: Модель подглядывает в будущее и показывает метрику, которой в реальности не будет

Как исправить: Временной split: обучение до даты, проверка после. Ту же границу держи и внутри признаков

Метрика без связи с решением

Почему мешает: ROC-AUC 0.95 никого не радует, если после результата никто не поменял ни одного действия

Как исправить: До обучения ответь: кого ранжируем, кому звоним, что отключаем. Метрику подбирай под это

Не ищут утечку признаков

Почему мешает: Самая частая причина, по которой модель отлично работает в ноутбуке и разваливается на практике

Как исправить: По каждому признаку спроси: он существовал в момент предсказания? Подозрительно сильные признаки проверяй отдельно

Пропускают SQL

Почему мешает: Данные берут из готового csv, а в работе выборку собираешь сам: SQL — в 63.7% вакансий Data Scientist

Как исправить: Выборки, соединения, группировки, оконные функции и поиск дублей — до первой модели

Ноутбук вместо исследования

Почему мешает: Сорок ячеек без вопроса и вывода читать невозможно, а работодатель читает именно это

Как исправить: README: вопрос, данные, baseline, метрика, ограничения. Ноутбук запускается сверху вниз

Не смотрят на ошибки модели

Почему мешает: Средняя метрика прячет сегменты, где модель врёт систематически и где ошибка стоит дороже всего

Как исправить: Разбор по сегментам, важность признаков, SHAP — и отдельный список случаев недоверия

LLM-демо без оценки

Почему мешает: RAG — в 26.2% вакансий Data Scientist, но прототип без замера поиска и галлюцинаций не отличается от игры с промптами

Как исправить: Собери набор вопросов с эталонными ответами и померяй качество, прежде чем показывать

Как SkillStat считает данные

Источник: 168 вакансий в московском сегменте. Навыки и грейды извлекаются автоматически из текста каждой вакансии.

Грейды: определяются по требованиям вакансии — уровню опыта, упоминанию «junior», «intern», «стажёр». Это рыночная оценка объявления.

Сложность входа: рассчитывается по доле junior-вакансий и медиане навыков на junior-уровне. Это индикатор, а не гарантия.

Обновление: данные пересчитываются регулярно. Текущий срез — 12 августа 2026.

Частые вопросы

Можно ли стать Data Scientist с нуля?
Да, если под «с нуля» имеется в виду отсутствие коммерческого опыта. Уровня junior и стажёра — 12 из 168 вакансий Data Scientist. Берут за метод: умение поставить вопрос к данным, построить baseline, выбрать метрику и честно её проверить. Диплом этого не подтверждает, два доведённых исследования — подтверждают.
Чем Data Scientist отличается от ML-инженера?
Границей ответственности. Data Scientist отвечает за вопрос, метрику и вывод: что предсказываем, какой ошибкой платим, какое решение меняется. ML-инженер отвечает за то, чтобы модель жила в продукте: сервис инференса, версии, выкатка, откат, дрейф. Разница видна по стеку — здесь на первых местах статистика, scikit-learn (31.5%) и бустинг, у ML-инженера рядом с Python стоят Docker, сервис и мониторинг качества после релиза. В маленьких командах роли совмещают.
Чем Data Scientist отличается от дата-аналитика?
Аналитик отвечает на вопрос «что произошло и почему»: выгрузка, срез, дашборд, объяснение факта. Data Scientist отвечает на вопрос «что произойдёт и что с этим делать»: прогноз, ранжирование, классификация плюс оценка, насколько выводу можно верить. Общий у ролей SQL — он в 63.7% вакансий Data Scientist. Расходятся на статистике, валидации и ответственности за решение по модели.
Нужна ли математика и статистика?
Это ядро роли, а не бонус. Распределения, выборка, дисперсия, доверительный интервал, гипотезы, ошибки первого и второго рода, размер выборки для эксперимента. Библиотека посчитает что угодно и не предупредит, что результат случайный, — за это отвечаешь ты. Линейная алгебра и производные нужны для понимания моделей, но спрашивают их реже, чем статистику.
Нужен ли SQL?
Да, это второй по частоте навык профессии: 63.7% вакансий (107 из 168). Готовый csv в работе не выдают — выборку собираешь сам, и половина ошибок исследования рождается на этом шаге. Минимум: выборки, соединения, группировки, оконные функции, фильтры по датам и поиск дублей. PostgreSQL — в 14.3% вакансий.
Нужен ли PyTorch?
PyTorch — в 41.1% вакансий Data Scientist (69 из 168), это самый заметный технический навык после Python и SQL. Но нужен он там, где есть нейросети, embeddings, тексты или изображения. На табличной задаче он не заменит статистику, baseline и валидацию: сначала метод, потом архитектура. TensorFlow встречается реже — 13.1%.
Нужен ли градиентный бустинг?
Для табличных задач это рабочая лошадь. CatBoost — в части вакансий Data Scientist, LightGBM — в 12.5%, XGBoost — в 13.1%. Хватит одного, разобранного глубоко: как устроены деревья и шаги, откуда берётся переобучение, как читать важность признаков. Перебирать все три бессмысленно.
Нужны ли LLM и RAG?
Заметная часть рынка: LLM — в 41.1% вакансий Data Scientist, RAG — в 26.2%, LangChain — в 20.8%. Ценность появляется, когда умеешь оценивать: качество поиска по документам, галлюцинации, границы применения. Прототип без замера — демо. Статистику и классический ML это не заменяет: их спросят в любом случае.
Нужны ли Spark и Hadoop?
Это соседний слой: Apache Spark — в 31.5% вакансий Data Scientist, Apache Hadoop — в 23.8%. Нужны там, где данные не помещаются в pandas. Для входа хватит понимания, зачем распределённая обработка и чем ленивые вычисления отличаются от привычных. Data Engineer из тебя это не делает и не должно.
Нужен ли Docker?
Полезен: Docker — в 20.8% вакансий Data Scientist (35 из 168). Но задача здесь другая, чем у инженера: не поднять сервис, а сделать исследование воспроизводимым — чтобы результат повторился у коллеги и через полгода у тебя. Уровня «собрать образ и запустить окружение» достаточно.
Что такое leakage и почему на нём заваливают?
Утечка будущего — это когда в обучающую выборку попадает информация, которой в момент предсказания ещё нет: признак, посчитанный после события, или случайное разбиение временного ряда. Метрика взлетает, модель на практике не работает. Спрашивают почти всегда: вопрос отделяет того, кто вёл исследование, от того, кто прогонял примеры из учебника.
Считается ли Kaggle за портфолио?
Частично. Соревнование показывает, что ты умеешь выжимать метрику на готовой постановке и готовых данных. Роли нужно обратное: сформулировать вопрос, собрать выборку запросом, найти в ней смещение и сказать, где выводу верить нельзя. Рабочая комбинация — одно соревнование плюс два своих исследования от вопроса до вывода.
Какие проекты собрать в портфолио?
Два-три законченных исследования вместо десяти ноутбуков. В каждом: вопрос, данные, проверка качества, baseline, метрика, валидация, разбор ошибок, ограничения. Опирайся на ключевые навыки профессии — Python, SQL, pandas. Один домен на всё портфолио читается лучше, чем случайный набор тем.
Сколько времени нужно, чтобы стать Data Scientist?
Медиана при самостоятельном обучении с нуля — 18–24 месяца: статистика, SQL, классический ML и три доведённых кейса. С математической базой из вуза и интенсивным темпом — 9–12 месяцев. Дольше всего тянется не код, а привычка проверять себя.
Нужно ли высшее образование?
Формально требуют редко, но математическая база отсеивает сильнее диплома. Физмат, экономика и инженерные специальности дают фору: вероятность и статистику закрывать придётся в любом случае. Без вуза путь длиннее, но проходим — при условии, что статистику ты действительно выучил, а не пролистал.
Сколько зарабатывает начинающий Data Scientist?
Ориентир для junior — 128 250–185 250 ₽ при медиане 285 000 ₽ по профессии. Разбивка по грейдам и динамика по месяцам — на странице зарплат.
Когда начинать откликаться на вакансии?
Когда есть два исследования и ты можешь защитить выбор метрики и разбиения. Для входа сейчас — 12 вакансий из 168. Откликайся параллельно с учёбой: разбор на собеседовании даёт больше, чем ещё один курс.
Где посмотреть навыки и зарплаты Data Scientist?
На странице навыков — частотность по 168 вакансий и разбивка по грейдам. На странице зарплат — медиана, вилка и динамика по месяцам.