Workcofy
← Todas las oportunidades

Senior AI Research Engineer

Improving

IA
EmpleoRemotoSeniorDatos
Ubicación
Remoto
Publicada
Hace 1 mes
Fuente
Get on Board
Ver oportunidad en Get on BoardLa postulación se realiza en el sitio original.

Requisitos Indispensables • Nivel de inglés intermedio-avanzado o avanzado (indispensable) • 4+ años construyendo software, con 2+ años llevando a producción sistemas basados en LLM • Python sólido — async, streaming, salidas estructuradas, observabilidad — además de comodidad con infraestructura en la nube (AWS preferido) • Experiencia práctica con patrones agénticos: uso de herramientas, bucles de planificación, gestión de estado, ejecución de largo alcance • Buenos instintos de evaluación: capaz de diseñar una evaluación que realmente mida lo que importa, y sabe distinguir cuándo un resultado es señal o ruido • Cómodo leyendo artículos y traduciendo ideas en código funcional; no necesita un doctorado para hacerlo, pero sí necesita la curiosidad • Trayectoria comprobada de llevar sistemas de prototipo a producción — se responsabiliza de la confiabilidad, la latencia y el costo, además de la calidadSeñales que Buscamos • Igualmente alérgico(a) a "lanzar sin medir" y a "medir para siempre sin lanzar". • Investigador(a) pragmático(a) / ingeniero(a) curioso(a) — elige el modo correcto según el problema. • Opiniones firmes sobre los modos de fallo de los agentes a nivel de sistema, no solo a nivel del modelo. • Se comunica con claridad ante distintas audiencias — puede explicar un resultado de evaluación complicado a un PM y una arquitectura de memoria a un investigador. • Eleva el estándar del equipo tanto en rigor como en velocidad tiene que ser una buena traducción es aes correcta.

Qué harás • Construir sistemas agénticos (agentic systems) de nivel de producción mientras te mantienes cerca de la frontera de la investigación — el puesto vive en el punto de encuentro entre "lánzalo" y "¿es este el enfoque correcto?" • Prototipar patrones novedosos de agentes (self-evolving loops, orquestación multiagente, arquitecturas de memoria), validarlos con evaluaciones rigurosas (evals), y luego consolidarlos en servicios desplegados • Ser responsable de la infraestructura de evaluación de principio a fin: diseñar golden datasets, construir harnesses de LLM-as-judge, ejecutar experimentos y usar los resultados para guiar decisiones técnicas • Leer artículos recientes y decidir qué vale la pena probar — ejecutar ablaciones rápidas, descartar ideas que no funcionan, y llevar a producción las que sí • Colaborar con ingenieros de plataforma en despliegue, latencia y costo • Contribuir en toda la pila tecnológica: diseño de agentes, recuperación/clasificación (retrieval/ranking), ingeniería de prompts y contexto, integración de herramientas (Claude Agent SDK, MCP, Bedrock)

Deseable • Experiencia con Claude Agent SDK, MCP, o marcos de agentes similares • Familiaridad con la metodología de LLM-como-juez, corrección de sesgo estadístico, o plataformas de evaluación (LangFuse, Braintrust, AgentCore) • Experiencia en recuperación/clasificación (embeddings, búsqueda híbrida, rerankers, resaltado semántico) • Exposición a sistemas auto-mejorables, escalado de cómputo en tiempo de inferencia (test-time compute), o investigación agéntica relacionada. • Experiencia en el dominio de GRC, tecnología legal, o software empresarial regulado • Contribuciones de código abierto, publicaciones en blogs, o resultados de investigación aplicada

pythonlarge language modelscloud infrastructureevaluationprompt engineeringorchestrationobservability