AQUÍ, aprende como en la empresa

Creamos este curso diseñado para resolver todos esos desafios empresariales que una academia normal no toma en cuenta.

Te enseñamos buenas prácticas, codificación, arquitecturas y arquetipos basados en estándares empresariales, lo que aprendas aquí lo aplicarás a la vida empresarial.

BENEFICIOS

✅ El profesor asesora empresas latinoamericanas en I.A. y Big Data
✅ Es un curso 100% de laboratorios prácticos
✅ Implementarás en las 4 nubes: Databricks, AWS, Azure y GCP, sobre un Data Lake
✅ Los materiales y grabaciones se quedan contigo para siempre
✅ Únete a nuestros alumnos, quienes en promedio completan 3 cursos
✅ Nuestros alumnos comienzan a trabajar lo aprendido desde el tercer mes

Al finalizar el curso tendrás las herramientas y el conocimiento disruptivo que te permitirá un alto salario.

¿𝐋𝐢𝐬𝐭𝐨 𝐩𝐚𝐫𝐚 𝐬𝐞𝐫 𝐮𝐧 𝐃𝐚𝐭𝐚 𝐄𝐧𝐠𝐢𝐧𝐞𝐞𝐫 𝐒𝐞𝐧𝐢𝐨𝐫❓

En menos de 3 meses tendrás la capacidad de:

ARQUITECTURAS DE BIG DATA, CLOUD COMPUTING Y DATA ENGINEERING: Aprende los fundamentos arquitectónicos que debe dominar un Data Engineer para diseñar soluciones modernas de datos. Comprende las arquitecturas de Big Data, almacenamiento y procesamiento distribuido, Cloud Computing y el funcionamiento de tecnologías como Hadoop, trabajando mediante laboratorios prácticos desde Google Colab y Databricks.

DATA LAKE, DELTA LAKE Y ARQUITECTURAS MEDALLION: Aprende a diseñar y construir arquitecturas Data Lake utilizando zonas BRONZE y SILVER para organizar el aterrizaje, procesamiento y aseguramiento de calidad de los datos. Trabaja con Hive, formatos optimizados como PARQUET y DELTA, tablas particionadas y estrategias de particionamiento dinámico para procesar grandes volúmenes de información de forma eficiente.

PROCESAMIENTO BIG DATA CON APACHE SPARK: Domina Apache Spark como uno de los principales motores de procesamiento distribuido utilizados en proyectos empresariales de Big Data. Aprende a leer y escribir información, definir esquemas de metadatos y desarrollar transformaciones utilizando Select, Filter, Group By y Join sobre DataFrames mediante laboratorios completamente prácticos.

PROCESAMIENTO AVANZADO CON SPARK, UDF, JSON Y XML: Lleva tus conocimientos de Spark a escenarios avanzados mediante la creación de funciones UDF de uno y múltiples parámetros, procesamiento de información semi-estructurada en formatos JSON y XML e incorporación de librerías externas desde repositorios Maven. Implementa arquetipos reutilizables de procesamiento que podrás aplicar en proyectos reales de Data Engineering.

DATA ENGINEERING Y DELTA LAKE SOBRE AWS: Implementa una arquitectura completa de datos sobre Amazon Web Services. Aprende a trabajar con redes VPC, identidades y políticas IAM, AWS Glue para procesos de calidad, Apache Spark para procesamiento distribuido, Amazon Athena como capa semántica de consultas, AWS Step Functions para flujos de procesos y Amazon EventBridge para la orquestación de soluciones de datos.

DATA ENGINEERING Y BIG DATA SOBRE MICROSOFT AZURE: Construye soluciones de procesamiento y almacenamiento utilizando el ecosistema de Microsoft Azure. Aprende a implementar arquitecturas con Azure Synapse Analytics, Azure Databricks, Storage, Dataflows, Synapse Spark Pool, HDInsight y Synapse SQL, integrando cada servicio dentro de una arquitectura Data Lake orientada a escenarios empresariales.

DATA ENGINEERING Y BIG DATA SOBRE GOOGLE CLOUD: Desarrolla arquitecturas de datos utilizando los principales servicios de Google Cloud Platform. Aprende a configurar proyectos e identidades, desplegar Cloud Data Fusion y Cloud Composer, implementar procesos de calidad, utilizar Apache Spark para procesamiento distribuido, consultar información mediante BigQuery y construir flujos de orquestación para soluciones Data Lake sobre GCP.

PROCESAMIENTO DE DATOS EN REAL-TIME CON APACHE KAFKA: Aprende a diseñar soluciones de ingesta y procesamiento de información en tiempo real utilizando Apache Kafka. Comprende la arquitectura de tópicos, instala y configura Kafka y ZooKeeper, integra librerías de Kafka con PySpark y desarrolla Producers y Consumers para implementar pipelines de eventos y arquitecturas Real-Time.

ARQUITECTURAS EMPRESARIALES, GOBIERNO DE DATOS Y DATA LAKES: Aprende a diseñar arquitecturas empresariales de datos considerando diferentes variaciones de Data Lake, integración entre ambientes On-Premise y Cloud, arquitecturas híbridas y patrones de ingesta para datos estructurados, semi-estructurados y no estructurados. Comprende cómo organizar las capas de procesamiento y modelamiento para construir soluciones gobernadas, escalables y reutilizables.

PATRONES, ARQUETIPOS Y ESTÁNDARES MULTI-CLOUD: Aprende a implementar soluciones siguiendo patrones y arquetipos reutilizables en lugar de desarrollar cada proyecto desde cero. Aplica una estructura común de Data Engineering sobre Databricks, AWS, Azure y GCP, permitiéndote trasladar los mismos principios de arquitectura, procesamiento, almacenamiento, calidad y orquestación entre diferentes plataformas Cloud.

CIENCIA DE DATOS Y MACHINE LEARNING PARA DATA ENGINEERS: Amplía tu perfil comprendiendo cómo los datos preparados por un Data Engineer son utilizados posteriormente en proyectos de Ciencia de Datos y Machine Learning. Aprende Data Preparation con Spark y Pandas, variables Dummy, entrenamiento y validación de modelos, Regresión Lineal, mínimos cuadrados y gradiente descendente.

MACHINE LEARNING E INTELIGENCIA ARTIFICIAL SOBRE AWS: Implementa de forma práctica un modelo predictivo utilizando servicios especializados de AWS. Aprende a trabajar con Amazon Athena, PySpark y Amazon SageMaker, prepara la infraestructura de entrenamiento, desarrolla un modelo de Regresión Lineal y evalúa sus resultados utilizando métricas como Error Absoluto, Error Cuadrático Medio y R² Score.

MACHINE LEARNING, DEEP LEARNING E I.A. GENERATIVA EN LA EMPRESA: Comprende cómo Machine Learning, Deep Learning, Inteligencia Artificial e Inteligencia Artificial Generativa se integran dentro de las plataformas modernas de datos. Conoce el papel que cumple el Data Engineer en la preparación, calidad y disponibilidad de la información necesaria para desarrollar soluciones avanzadas de analítica e I.A. en escenarios empresariales.

FORMACIÓN PRÁCTICA MULTI-CLOUD ORIENTADA AL MUNDO EMPRESARIAL: Consolida los conocimientos mediante decenas de laboratorios y ejercicios prácticos que recorren desde Hadoop, Spark y Data Lake hasta arquitecturas completas sobre AWS, Azure y GCP, procesamiento Real-Time con Kafka, Gobierno de Datos y Machine Learning. El objetivo es que puedas trasladar estos conocimientos a proyectos reales de Data Engineering y Big Data.

No se necesita experiencia previa, ya que aprenderás desde cero.

 

¡Un total de 12 sesiones en vivo!

Conoce el temario de 12 sesiones divididas en 8 módulos

  • MÓDULO 1: ARQUITECTURAS DE BIG DATA

    • Arquitecturas de Big Data
    • Arquitecturas de Cloud Computing
    • Tecnologías sobre Big Data
    • Infraestructura de almacenamiento y procesamiento
    • Hadoop como ecosistema de almacenamiento
    • Trabajando de manera distribuida sobre un clúster
    • Hadoop como estándar en el mundo del Big Data
    • HDFS como motor de almacenamiento
    • YARN como gestor de recursos
    • MapReduce vs Spark como motor de procesamiento
    • Preparación de entornos
    • Capacidad física de un clúster
  • MÓDULO 2: PROCESAMIENTO DISTRIBUIDO CON HIVE

    • Hive como infraestructura de almacenamiento
    • SQL sobre Spark
    • Archivos de HDFS como tablas Hive
    • Particionamiento estático y dinámico
    • Formatos binarios de archivos: Parquet, Delta
    • Compresión optimizada de datos
    • Configuración y tuneo de procesos en Hive
    • Sqoop como motor de ingesta de datos
    • Importando datos a Hadoop a bases de datos relacionales
    • Arquetipo de ingesta de datos batch
    • Arquetipo de modelamiento de datos
    • Arquetipo de procesamiento de datos
  • MÓDULO 3: PROCESAMIENTO SOBRE SPARK

    • Python con Spark para PySpark
    • Programación funcional
    • Dataframes para datos estructurados y semi-estructurados
    • Transformations y operations en dataframes
    • Creación de funciones personalizadas con UDFs
    • UDFs con multi-parámetros
    • Almacenamiento en formatos binarios de rápido procesamiento: Parquet y Delta
    • Procesamientos en pasos encadenados
    • Procesamientos en pasos separados
    • Liberación de memoria con el Garbage Collector
  • MÓDULO 4: PROCESAMIENTO SEMI-ESTRUCTURADO & INSTALACIÓN DE LIBRERÍAS

    • Lectura de archivos JSON
    • Lectura de archivos XML
    • Dataframes semi-estructurados
    • Definición del esquema de formato semi-estructurado
    • Patrón de diseño de modelamiento semi-estructurado
    • Navegación de campos complejos
    • Navegación manual de campos array
    • Navegación automática de campos array
    • Trazabilidad y debugeo de errores
    • Instalación de librerías desde repositorios públicos
    • Instalación de librerías desde repositorios privados
  • MÓDULO 5: BIG DATA ON AWS

    • Servicios de Big Data disponibles en AWS
    • Arquitectura de Big Data sobre AWS
    • Implementación de un Data Lake para Gobierno de Datos sobre AWS
    • Ingesta y almacenamiento de datos sobre el S3
    • Interfaz SQL de AWS con Athena
    • Implementación de flujos ETL con Glue
    • Infraestructura para clústers de Big Data con EMR
    • Implementación de soluciones con Spark para EMR
    • Despliegues y workflows con Wokflows for Glue y Step Functions
  • MÓDULO 6: BIG DATA ON AZURE

    • Servicios de Big Data disponibles en Azure
    • Arquitectura de Big Data sobre Azure
    • Implementación de un Data Lake para Gobierno de Datos sobre Azure
    • Ingesta y almacenamiento de datos sobre el Blob Storage
    • Datasets sobre Data Factory
    • Implementación de flujos ETL con Dataflow
    • Infraestructura para clústers de Big Data con HDInsight
    • Implementación de soluciones con Spark para HDInsight
    • Despliegues y workflows con Data Factory
  • MÓDULO 7: BIG DATA ON GCP

    • Servicios de Big Data disponibles en GCP
    • Arquitectura de Big Data sobre GCP
    • Implementación de un Data Lake para Gobierno de Datos sobre GCP
    • Ingesta y almacenamiento de datos sobre el Cloud Storage
    • Interfaz SQL de GCP con Bigquery
    • Implementación de flujos ETL con Data Fusion
    • Infraestructura para clústers de Big Data con Dataproc
    • Implementación de soluciones con Spark para Dataproc
    • Despliegues y workflows con Cloud Composer
  • MÓDULO 8: PROCESAMIENTO REAL-TIME SOBRE BIG DATA

    • Procesamiento de datos real time
    • ¿Streaming, real time, near real time o micro batch?
    • Arquitectura general para proyectos real time
    • Captura de datos desde fuentes real time: tormenta de datos
    • La elasticidad en la capa de captura y procesamiento
    • La importancia de la paralelización elástica
    • Evitando el colapso de CPU
    • Kafka como repositorio temporal de baja latencia
    • Tópico, producers y consumers
    • Tuning de tópicos
    • Procesamiento real time con Spark Streaming
    • Arquetipo de procesamiento real time
    • Arquetipo enriquecimiento real time
    • Limitaciones y cómo superarlas

Profesor

"He trabajado con todo tipo de proyectos, desde pequeños de unos cuántos miles de dólares, hasta muy grandes de presupuestos de millones de dólares"

EXPERTO EN IA PARA BANCOS Y FINANCIERAS
✅14 años de experiencia en Big Data e Inteligencia Artificial
✅12 años de experiencia como docente universitario
✅Más detalles de mi perfil: LINKEDIN

Alonso Melgarejo

"En 2026, continuamos liderando el avance de proyectos innovadores de Inteligencia Artificial en toda Latinoamérica"




"Melgarejo fue considerado uno de los pocos arquitectos de Big Data en 2016"




MATRICÚLATE

OFERTA

¡De regalo un videocurso de 30 sesiones!

  1. Curso de Data Engineer & Big Data Multi-Cloud +
  2. Videocurso de Fundamentos de Spark para Big Data

Todo por 119 dólares

🚨

¿Quieres una mejor oferta?

Sólo por esta semana tienes acceso a una oferta especial, sigue leyendo y conócela

¡Llévate mucho más!

Sólo por esta semana, para las 10 primeras matrículas

Te llevas:

  1. 🧑‍💻CURSO EN VIVO: de Data Engineer & Big Data Multi-Cloud
  2. 🎁VIDEOCURSO: Fundamentos de Spark para Big Data
  3. 🎁EDICIÓN GRABADA: Del curso "Arquitectura para Entornos de Big Data & Cloud" de 6 sesiones, valorizado en 100 dólares
  4. 🎁WORKSHOP GRABADO: De 3 días de "Construye tu Primer Data Lake"

PROMOCIÓN: Sólo a ⚡$199 dólares *

*Válido hasta agotar las 10 primeras matrículas, agotadas las vacantes el botón se deshabilitará

📋

Requisitos

Conocimientos básico en cualquier lenguaje de programación

🎓

Certificación Internacional

Al finalizar el curso obtendrás los certificados de "Big Data Engineer Professional" y "Big Data Architect Fundamentals"

Preguntas Frecuentes

  • ¿Qué es Big Data Academy (BDA)?

    Somos una empresa que tiene como objetivo desbloquear todo tu potencial en Big Data, Inteligencia Artificial y Cloud Computing

  • ¿Hay cursos para principiantes?

    Sí, desde workshops de primeros pasos hasta cursos y programas completos

  • ¿Hay cursos para empresas o grupos grandes?

    Sí, con buenos descuentos, puedes escribirnos a nuestro WhatsApp (+51 907 999 456)

  • ¿Cuáles son los cursos en los que puedo matricularme?

    Puedes encontrar los cursos y programas desde el siguiente enlace: CURSOS

  • ¿Cuáles son los requisitos para matricularme en un curso?

    Puedes revisar el brochure o la web de cada curso para conocer su detalle

  • ¿Qué tipo de computadora requiero para iniciar un curso?

    Una computadora simple, usamos infraestructura en la nube para practicar, puedes acceder incluso desde tu tablet

  • ¿Cuántas horas semanales requiero para llevar un curso?

    Depende de ti, pero te recomendamos de 2 a 3 horas semanales