Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
HealthTech-стартап создаёт продукт поддержки врачебных решений, который помогает сделать процессы в здравоохранении эффективнее и врачам принимать более точные решения. Команда строит единую платформу данных и ML/LLM-платформу — путь данных от загрузки из разных источников до измеренного результата модели.
задачи
Разрабатывать пайплайны загрузки и обработки данных из файлов, API и информационных систем на Python и SQL;
Проектировать таблицы хранилища, сущности, связи и правила преобразования;
Встраивать псевдоанонимизацию и проверки качества в потоки данных;
Готовить признаки и версионируемые выборки для обучения, валидации и тестирования;
Обеспечивать прослеживаемость и воспроизводимость экспериментов с ML/LLM;
Развивать вместе с ML-командой оценку моделей и подготовку данных для RAG и дообучения.
требования
Уверенно владеть Python и SQL, писать поддерживаемый код за пределами ноутбуков;
Иметь практический опыт ETL/ELT: оркестрация, инкрементальная обработка, повторные запуски;
Иметь опыт работы с S3, Parquet, pandas, Polars или PyArrow;
Понимать жизненный цикл ML: выборки, базовый уровень, метрики и проверка утечек;
Иметь опыт работы с MLflow, ClearML или аналогами, Linux, Git, Docker и CI/CD;
Уметь работать с чувствительными данными;
Будет плюсом опыт с медицинскими данными, МИС и клиническими справочниками, практический NLP/LLM, извлечение данных из текста, embeddings и RAG, PyTorch/Hugging Face, дообучение и inference на GPU, превращение исследовательского прототипа в регулярный пайплайн.