¿Qué ofrecemos?
Contrato obra labor
Salario a convenir
Modalidad 100% remoto
1. Objetivo del Rol
Diseñar, construir y optimizar pipelines de datos a gran escala para el ecosistema de Nequi, garantizando el procesamiento eficiente de grandes volúmenes de información tanto en batch como en tiempo real. El ingeniero trabajará en una célula ágil orientada a data, apoyando la toma de decisiones del negocio mediante soluciones robustas y escalables en la nube.
2. Conocimientos Técnicos Requeridos
2.1 Apache Spark (Excluyente – Nivel Avanzado)
• Dominio profundo de PySpark y Spark SQL para transformaciones complejas
• Optimización de jobs: particionamiento, caching, broadcast joins, tuning de memoria y paralelismo
• Manejo de DataFrames, Datasets y RDDs
• Desarrollo y mantenimiento de pipelines batch en entornos distribuidos
• Integración de Spark con sistemas de almacenamiento (S3, Delta Lake, Parquet, Hive)
2.2 Procesamiento de Streaming (Excluyente – Nivel Medio-Avanzado)
• Apache Kafka: producción, consumo, topics, consumer groups, gestión de offsets
• Spark Structured Streaming o Apache Flink para procesamiento en tiempo real
• Patrones de diseño: event sourcing, exactamente una vez (exactly-once), ventanas de tiempo
• Manejo de datos en movimiento para casos de uso financiero/transaccional
2.3 Amazon Web Services – AWS (Excluyente – Nivel Medio)
• AWS Glue para orquestación y catalogación de datos
• Amazon S3 como data lake: particionamiento, ciclo de vida, optimización de costos
• Amazon EMR para clústeres Spark gestionados
• Amazon Kinesis o MSK (Managed Streaming for Apache Kafka) para streaming
• AWS Lambda para procesamiento serverless complementario
• AWS IAM, VPC y gestión de seguridad básica en entornos de datos
2.4 Orquestación y DevOps de Datos
• Apache Airflow o AWS Step Functions para orquestación de workflows
• Infraestructura como código: Terraform o AWS CDK (deseable)
• CI/CD para pipelines de datos (GitHub Actions, AWS CodePipeline)
• Manejo de control de versiones con Git
3.5 Lenguajes y Formatos
• Python (nivel avanzado, principal lenguaje de desarrollo)
• SQL avanzado para transformaciones y análisis
• Formatos de datos: Parquet, Avro, JSON, Delta Lake
4. Experiencia Requerida
• Mínimo 3 años de experiencia en ingeniería de datos
• Al menos 2 años trabajando con Apache Spark en entornos productivos de alto volumen
• Experiencia comprobable en proyectos de streaming de datos en tiempo real
• Experiencia en AWS con al menos dos de los servicios mencionados en producción
• Deseable: experiencia en sector financiero, fintech o banca digital
• Deseable: experiencia trabajando en metodologías ágiles (Scrum/SAFe)