Workcofy
← Todas las oportunidades

Ingeniero ML / Data Scientist

Lisit

IA
EmpleoRemotoSeniorDatos
Ubicación
Remoto
Publicada
Hace 2 semanas
Fuente
Get on Board
Ver oportunidad en Get on BoardLa postulación se realiza en el sitio original.

Requisitos excluyentes Excluyente • Python sólido (pandas, scikit-learn) y experiencia real llevando un modelo a producción en NLP en español. • Experiencia con tokenización, normalización de texto y manejo de errores ortográficos. • Experiencia con Transformers / Hugging Face para fine-tuning de BERT (ideal BETO u otro BERT en español) orientado a NER. • Etiquetado programático / weak supervision: construir datasets de entrenamiento sin etiquetado manual masivo. • Evaluación rigurosa: precision/recall/F1, conjuntos held-out y control de fuga de datos. Cómo evaluamos el enfoque: necesitamos que puedas explicar de forma clara cómo construirías el dataset de entrenamiento cuando no existe corpus etiquetado y hay 1,8 M de pares históricos; y qué significa que un modelo esté calibrado y cómo lo comprobarías. We valoramos además una forma de trabajo ordenada y comunicable: foco en reproducibilidad, pensamiento crítico sobre métricas (held-out y fuga de datos) y mentalidad de transferencia hacia el cliente.

Misión Misión: construir el corpus de entrenamiento a partir de 1,8 millones de pares históricos; hacer fine-tuning de un modelo NER en español; calibrar el score de confianza; y dejar el pipeline reproducible y traspasable al cliente. • Construir el dataset de entrenamiento sin etiquetado manual masivo (etiquetado programático / weak supervision). • Realizar tokenización y normalización de texto para NLP en español. • Entrenar y ajustar un modelo para NER en español (idealmente BERT en español, como BETO u otro BERT en español) con Transformers / Hugging Face. • Gestionar errores ortográficos y robustez del preprocesamiento. • Evaluar rigurosamente el desempeño con precision/recall/F1 usando conjuntos held-out y control de fuga de datos. • Calibrar probabilidades para que el umbral de confianza sea interpretable (score calibrado con métodos como Platt o isotónica). • Garantizar reproducibilidad: documentación del pipeline, trazabilidad de experimentos y empaquetado para que el cliente pueda replicarlo y operarlo.

Deseable (suma puntos) • XGBoost y calibración de probabilidades (Platt / isotónica): el umbral de 0,82 debe significar probabilidad real. • Embeddings y búsqueda vectorial (pgvector, HNSW, sentence-transformers). • Fuzzy matching: distancias de edición, algoritmos fonéticos, pg_trgm. • MLflow para gestión de experimentos y despliegue. • ONNX y cuantización INT8 para inferencia eficiente en CPU (sin GPU). • libpostal. • Experiencia con direcciones postales, geocodificación o datos geográficos.

pythonpandasscikit-learnnatural language processinghugging face transformers