数据科学家(高级)
[Job 31517] Data Scientist SR
职位要求
在数字产品团队中具有经验,优先考虑个性化、推荐或智能CRM领域
产品思维:您交付的是业务结果,而不是模型
能够处理交易数据和操作数据(不仅仅是点击流或分析数据)
熟悉客户统一身份概念及实体解析(entity resolution)的挑战
具备辨别何时使用机器学习模型是正确选择的批判性思维——以及何时通过校准良好的规则可以更好地解决问题
职责
客户上下文和意图建模 —— 开发分类、倾向性和行为事件的实时(近实时)模型
下一步最佳行动(NBA)—— 构建并优化基于上下文而非静态商业规则的客户动作和沟通优先级逻辑
交易事件的特征工程 —— 将系统事件(支付、索赔、续订、互动)转化为丰富的机器学习模型特征
与架构团队合作,确保细分和身份信号可被上下文引擎(如CRM)使用
实验与验证 —— 设计和分析A/B测试,评估个性化决策对业务KPI的影响
文档与治理 —— 确保模型可追溯性、版本控制和生产中的漂移监控
必备条件
扎实的Python数据和建模经验(pandas、scikit-learn、PySpark)
扎实的监督学习算法经验,尤其是分类和排序模型(XGBoost、LightGBM)
在实时事件处理和消费方面有实践经验,使用Kafka或Kinesis等工具
在特征存储和生产模型特征管理方面有实践经验(Feast、Tecton、Hopsworks或类似工具)
在A/B测试和因果推断基础应用于数字产品方面有实践经验
在云平台(AWS或GCP)上进行数据摄入、存储和处理的经验(S3/GCS、BigQuery/Redshift、Glue/Dataflow)
加分项
在实时机器学习推理中使用流处理的经验(Flink、Spark Structured Streaming)
在个性化或用户意图分类场景中应用LLMs和GenAI的经验
在数据管道编排工具(Airflow)方面的经验
查看英文原文
Perfil que Buscamos
Experiência prévia em squads de produto digital, preferencialmente em personalização, recomendação ou CRM inteligente
Mentalidade de produto: você não entrega modelo, você entrega resultado de negócio
Conforto em trabalhar com dados transacionais e operacionais (não apenas clickstream ou Analytics)
Familiaridade com o conceito de identidade unificada de cliente e desafios de resolução de entidades (entity resolution)
Senso crítico para distinguir quando um modelo de ML é a resposta certa — e quando uma regra bem calibrada resolve melhor
Responsabilidades
Modelagem de contexto e intenção do cliente — desenvolver modelos de classificação, propensão e detecção de eventos comportamentais em tempo (near) real
Next Best Action (NBA) — construir e evoluir a lógica de priorização de ações e comunicações por cliente, orientada ao contexto e não a regras comerciais estáticas
Feature Engineering para eventos transacionais — transformar eventos sistêmicos (pagamentos, sinistros, renovações, interações) em features ricas para modelos de ML
Trabalhar junto à arquitetura para garantir que os sinais de segmentação e identidade sejam consumíveis pelo motor de contexto (ex.: CRM)
Experimentação e validação — desenhar e analisar experimentos A/B para avaliar o impacto das decisões de personalização nos KPIs de negócio
Documentação e governança — garantir rastreabilidade de modelos, versionamento e monitoramento de drift em produção
Requisitos obrigatórios
Sólida experiência com Python para análise e modelagem de dados (pandas, scikit-learn, PySpark)
Sólida experiência com algoritmos de ML supervisionado, especialmente modelos de classificação e ranking (XGBoost, LightGBM)
Experiência prática com processamento e consumo de eventos em tempo real, utilizando ferramentas como Kafka ou Kinesis
Experiência prática com o conceito de Feature Store e gestão de features para modelos em produção (Feast, Tecton, Hopsworks ou similares)
Experiência prática com A/B Testing e fundamentos de inferência causal aplicados a produtos digitais
Experiência prática com cloud (AWS ou GCP) para ingestão, armazenamento e processamento de dados (S3/GCS, BigQuery/Redshift, Glue/Dataflow)
Diferencial
Experiência com streaming de ML para inferência em tempo real (Flink, Spark Structured Streaming)
Experiência com LLMs e GenAI aplicados a contextos de personalização ou classificação de intenção do usuário
Experiência com ferramentas de orquestração de pipelines de dados (Airflow, Prefect ou similares)
Experiência com práticas de MLOps, incluindo versionamento, monitoramento de drift e deploy de modelos em produção (MLflow, Vertex AI, SageMaker)
Experiência com bancos de dados em grafo para modelagem de relacionamentos entre entidades como cliente, produto e canal (Neo4j ou similares)
Originally posted on Himalayas