Curso Big Data Principiante

Apache Hadoop Avanzado

Curso avanzado y práctico para diseñar, desplegar, administrar y optimizar clústeres Hadoop, trabajando con almacenamiento distribuido, procesamiento de datos, gestión de recursos, seguridad, monitoreo y resolución de problemas en escenarios Big Data reales.

Duración
20 horas · 4 semanas
Docente
Ing. David Cantorín
Comunidad
50+ estudiantes
Fecha de inicio
Inmediato
  • Acceso aula virtual
  • Grabación
  • Material
Apache Hadoop Avanzado
Inversión por programa
S/ 700
Hablar con asesor

Pago seguro · Culqi

  • Transferencia
    bancaria
Resumen del programa

Sobre el programa

Este curso proporciona una formación integral y avanzada en Apache Hadoop y arquitecturas Big Data distribuidas. El participante comprenderá la arquitectura interna de Hadoop y aprenderá a implementar y operar clústeres mediante HDFS y YARN, integrar herramientas del ecosistema, optimizar almacenamiento y procesamiento, gestionar recursos, implementar controles de seguridad y diagnosticar problemas de infraestructura.

El enfoque combina fundamentos arquitectónicos con laboratorios orientados a situaciones reales de Data Engineering y administración de plataformas Big Data, preparando al participante para diseñar soluciones escalables y operar entornos Hadoop empresariales.

Duración 20 horas · 4 semanas
Nivel Principiante
Categoría Curso
Tema Big Data

Aprendizaje práctico

Proyectos reales, laboratorios y casos de uso desde las primeras sesiones.

Docente Especialista

Ing. David Cantorín

Horarios flexibles

Rutas on demand y sesiones en vivo adaptadas a tu ritmo profesional.

Impulso profesional

Certificación, bolsa de trabajo y acompañamiento para tu siguiente rol.

Docente Especialista

Conoce a quien imparte este programa.

Ing. David Cantorín

Data Architect

Temario

Plan de estudios

10 módulos · Abre cada bloque para ver los temas

  1. Arquitectura Hadoop y fundamentos de sistemas distribuidos.
  2. Componentes del ecosistema: Hadoop Common, HDFS, YARN y MapReduce.
  3. Arquitectura Master/Worker y comunicación entre nodos.
  4. Diseño y dimensionamiento de arquitecturas Big Data empresariales.

  1. Preparación de servidores Linux, Java, SSH y variables de entorno.
  2. Instalación y configuración distribuida de Apache Hadoop.
  3. Configuración de HDFS, YARN y MapReduce mediante archivos XML.
  4. Despliegue, inicialización y validación de un clúster multinodo.

  1. Arquitectura HDFS: NameNode, DataNodes, bloques y replicación.
  2. Metadata, FsImage, EditLog, heartbeats y lectura/escritura distribuida.
  3. Capacidad, cuotas, ACL, snapshots y balanceo del clúster.
  4. Recuperación ante fallos y diagnóstico de bloques.

  1. Arquitectura YARN: ResourceManager, NodeManager y ApplicationMaster.
  2. Containers, memoria, vCores y ciclo de vida de aplicaciones.
  3. Schedulers, colas, prioridades y asignación de recursos.
  4. Monitoreo, diagnóstico y optimización de aplicaciones y nodos.

  1. MapReduce y ejecución de trabajos distribuidos.
  2. Integración de Apache Spark con Hadoop y ejecución sobre YARN.
  3. Apache Hive, Metastore, tablas, particiones y consultas SQL.
  4. Optimización con Parquet, Avro y compresión de datos.

  1. Arquitecturas de ingesta Batch y Streaming.
  2. Ingesta desde bases de datos, archivos y fuentes de eventos.
  3. Diseño de zonas Data Lake: Raw, Structured y Curated.
  4. Construcción de pipelines integrando Hadoop, Spark y Hive.

  1. Modelo de seguridad, usuarios, grupos, permisos y ACL.
  2. Autenticación y fundamentos de Kerberos.
  3. Autorización y políticas de acceso mediante Apache Ranger.
  4. Auditoría, protección de datos y buenas prácticas empresariales.

  1. Administración mediante CLI e interfaces web de Hadoop.
  2. Monitoreo de HDFS, YARN, CPU, memoria y almacenamiento.
  3. Diagnóstico de nodos UNHEALTHY, contenedores, discos y conectividad.
  4. Análisis de logs, recuperación de servicios y troubleshooting.

  1. Dimensionamiento de memoria, CPU, vCores y containers.
  2. Optimización de HDFS, YARN y parámetros de almacenamiento.
  3. Data locality, particionamiento, compresión y Small Files Problem.
  4. Optimización de Spark sobre YARN y análisis de cuellos de botella.

  1. HDFS High Availability y NameNode Active/Standby.
  2. JournalNodes, ZooKeeper y ResourceManager HA.
  3. Backup, Disaster Recovery y estrategias de continuidad.
  4. Mantenimiento, decommissioning y operación de clústeres en producción.
Competencias

Stack y habilidades

Habilidades

  • Arquitectura Big Data
  • Administración de clústeres Hadoop
  • Procesamiento distribuido de datos
  • Gestión avanzada de HDFS
  • Administración de recursos con YARN
  • Diseño de Data Lakes
  • Seguridad y gobierno de datos
  • Monitoreo y Troubleshooting
  • Performance Tuning
  • Alta disponibilidad y recuperación ante fallos

Herramientas

  • Apache Hadoop
  • HDFS
  • YARN
  • Apache Spark
  • Apache Hive
  • Apache Ranger
  • Apache ZooKeeper
  • MapReduce
  • Linux
  • Parquet / Avro

Oportunidades

  • Big Data Engineer
  • Hadoop Administrator
  • Hadoop Engineer
  • Data Engineer
  • Big Data Platform Engineer
  • Data Platform Engineer
  • Data Infrastructure Engineer
  • DataOps Engineer
  • Arquitecto Big Data
  • Consultor Big Data

Prerrequisitos

  • Conocimientos básicos de Linux
  • Manejo de línea de comandos
  • Fundamentos de bases de datos
  • Conocimientos básicos de SQL
  • Fundamentos de procesamiento de datos
  • Conocimientos básicos de Python o Java
  • Conceptos básicos de redes y servidores
  • Fundamentos de Big Data recomendables
Material del programa

Brochure del programa

Estamos preparando el brochure oficial de este programa.

Brochure pronto disponible

¿Listo para comenzar tu transformación profesional?

Más Información