Ingeniero ML / Data Scientist
Sobre este empleo
Requisitos excluyentes
Excluyente
- Python sólido (pandas, scikit-learn) y experiencia real llevando un modelo a producción en NLP en español.
- Experiencia con tokenización, normalización de texto y manejo de errores ortográficos.
- Experiencia con Transformers / Hugging Face para fine-tuning de BERT (ideal BETO u otro BERT en español) orientado a NER.
- Etiquetado programático / weak supervision: construir datasets de entrenamiento sin etiquetado manual masivo.
- Evaluación rigurosa: precision/recall/F1, conjuntos held-out y control de fuga de datos.
Cómo evaluamos el enfoque: necesitamos que puedas explicar de forma clara cómo construirías el dataset de entrenamiento cuando no existe corpus etiquetado y hay 1,8 M de pares históricos; y qué significa que un modelo esté calibrado y cómo lo comprobarías.
We valoramos además una forma de trabajo ordenada y comunicable: foco en reproducibilidad, pensamiento crítico sobre métricas (held-out y fuga de datos) y mentalidad de transferencia hacia el cliente.
Misión
Misión: construir el corpus de entrenamiento a partir de 1,8 millones de pares históricos; hacer fine-tuning de un modelo NER en español; calibrar el score de confianza; y dejar el pipeline reproducible y traspasable al cliente.
- Construir el dataset de entrenamiento sin etiquetado manual masivo (etiquetado programático / weak supervision).
- Realizar tokenización y normalización de texto para NLP en español.
- Entrenar y ajustar un modelo para NER en español (idealmente BERT en español, como BETO u otro BERT en español) con Transformers / Hugging Face.
- Gestionar errores ortográficos y robustez del preprocesamiento.
- Evaluar rigurosamente el desempeño con precision/recall/F1 usando conjuntos held-out y control de fuga de datos.
- Calibrar probabilidades para que el umbral de confianza sea interpretable (score calibrado con métodos como Platt o isotónica).
- Garantizar reproducibilidad: documentación del pipeline, trazabilidad de experimentos y empaquetado para que el cliente pueda replicarlo y operarlo.
Beneficios
Hibrido
Deseable (suma puntos)
- XGBoost y calibración de probabilidades (Platt / isotónica): el umbral de 0,82 debe significar probabilidad real.
- Embeddings y búsqueda vectorial (pgvector, HNSW, sentence-transformers).
- Fuzzy matching: distancias de edición, algoritmos fonéticos, pg_trgm.
- MLflow para gestión de experimentos y despliegue.
- ONNX y cuantización INT8 para inferencia eficiente en CPU (sin GPU).
- libpostal.
- Experiencia con direcciones postales, geocodificación o datos geográficos.
Lisit creamos, desarrollamos e implementamos servicios de software con foco constante en innovación y pasión por los desafíos. En este rol, trabajamos en la automatización y optimización de procesos mediante soluciones de NLP en español con impacto directo en la eficacia operativa de nuestros clientes. La misión del proyecto es construir y hacer evolucionar un pipeline reproducible a partir de
1,8 millones de pares históricos, transformándolo en un dataset de entrenamiento, entrenar y evaluar un modelo NER en español, calibrar el score de confianza y habilitar la transferencia del conocimiento y la solución al cliente para su adopción sostenida.
Referencia del mercado
Explorar empleos relacionados
Empleos similares
Desarrollador Full-Stack
Consultor SAP MM
Consultor SAP Fi Power
Ingeniero QA Automatizador
Desarrollador Back-end
Arquitecto de Datos
Preguntas frecuentes
¿Qué salario puedo esperar?
Este anuncio no muestra salario. Roles similares en Chile suelen pagar alrededor de 620 000 $ (mediana de 19 772 ofertas).
¿Cómo solicito este empleo?
Abre la página original de la fuente y contacta allí al empleador. Finder nunca cobra a los candidatos.
¿Estas ofertas están actualizadas?
Sí. Finder actualiza regularmente vacantes de fuentes públicas y elimina las cerradas.
¿Dónde ver el tipo de contrato y el formato de trabajo?
Las condiciones clave aparecen encima de la descripción. También puedes abrir listados relacionados de Lisit y Chile.
