Apache Kudu

Treinamento Apache Kudu

Sobre o Treinamento

O treinamento Apache Kudu é voltado para profissionais de Big Data e Engenharia de Dados que precisam de um armazenamento colunar de alta performance para suportar cargas de trabalho analíticas e de baixa latência simultaneamente. O Apache Kudu foi projetado para preencher a lacuna entre os sistemas de armazenamento HDFS, otimizados para leitura, e os bancos NoSQL, otimizados para escrita, oferecendo mutabilidade em tempo real combinada com desempenho analítico compatível com o ecossistema Hadoop.

Neste treinamento o aluno aprenderá a arquitetura interna do Kudu, os conceitos de tablet servers, masters, particionamento de tabelas e compactação, além de integrar o Kudu com Apache Impala e Apache Spark para consultas analíticas de alta velocidade. Serão exploradas APIs de acesso direto (Java e Python), estratégias de particionamento por range e hash, monitoramento de clusters e boas práticas de deploy.

O que vou aprender?

Ao final deste treinamento você será capaz de:

  • Compreender a arquitetura interna do Apache Kudu: Masters, Tablet Servers e replicação via Raft Consensus.
  • Modelar tabelas com particionamento por Hash, Range e combinado para alta performance de leitura e escrita.
  • Instalar e configurar um cluster Kudu standalone e multi-nó, inclusive integrado ao Cloudera Manager.
  • Realizar operações CRUD (Insert, Upsert, Update, Delete) via API Java e API Python.
  • Criar e consultar tabelas Kudu diretamente com SQL usando o Apache Impala.
  • Construir pipelines de ingestão em tempo real com Apache Spark Structured Streaming gravando em Kudu.
  • Integrar o Apache NiFi ao Kudu para fluxos de dados de alta vazão com o PutKudu Processor.
  • Monitorar e administrar o cluster Kudu com a Web UI, Prometheus e Grafana.
  • Aplicar segurança no cluster com autenticação Kerberos e criptografia TLS.
  • Identificar e corrigir problemas de replicação, compactação e performance.

Dificuldade: Intermediário / Avançado.

Aplicabilidade: Este treinamento foi desenvolvido usando o Apache Kudu 1.18.1 e foi modificado pela última vez em 13 de Julho de 2026.

Conteúdo Programático.

Conceitual Big Data e Armazenamento Colunar

  • Visão geral sobre Hadoop e o ecossistema de armazenamento.
  • Características e limitações do HDFS para cargas OLTP.
  • Comparativo: HBase X Kudu X Cassandra X Parquet.
  • Histórico e motivação do Apache Kudu.
  • Casos de uso do Kudu no mercado.
  • Empresas usando Kudu no mundo e no Brasil.
  • Posição do Kudu no ecossistema Cloudera

Arquitetura do Apache Kudu

  • Componentes: Kudu Master e Tablet Servers.
  • Tablets e particionamento de dados.
  • Modelo de dados: chaves primárias, colunas e tipos suportados.
  • Replicação e tolerância a falhas (Raft Consensus).
  • Compactação de dados e gerenciamento de memória (MemRowSet vs. DiskRowSet).
  • Redes e balanceamento de carga entre tablets.

Instalação e Configuração do Apache Kudu

  • Requisitos de sistema e hardware para produção.
  • Instalação standalone para desenvolvimento e testes.
  • Configuração em cluster multi-nó.
  • Integração com Cloudera Manager.
  • Configuração de replicação e número de réplicas.
  • Gerenciamento de tabelas via Kudu CLI e Web UI.
  • Deploy com Docker e Kubernetes.

Modelagem de Dados no Apache Kudu

  • Criação de schemas e definição de chaves primárias.
  • Estratégias de particionamento: Hash Partitioning e Range Partitioning.
  • Particionamento composto (Hash + Range).
  • Boas práticas de modelagem para alta performance de escrita e leitura.
  • Alteração de schemas em tabelas existentes.
  • Limitações de design e anti-padrões.

API Java do Apache Kudu

  • Configuração do ambiente de desenvolvimento Java com Maven.
  • KuduClient: conexão e gerenciamento de sessões.
  • Operações DML: Insert, Upsert, Update, Delete.
  • Leitura de dados: KuduScanner e predicados de filtro.
  • Controle de fluxo e FlushMode.
  • Tratamento de erros e retry policies.

API Python do Apache Kudu

  • Instalação e configuração do cliente Python.
  • Conexão ao cluster Kudu via Python API.
  • Operações CRUD com Python.
  • Integração com Pandas para análise de dados.
  • Casos práticos de ingestão de dados em tempo real.

Apache Kudu e Apache Impala

  • Visão geral da integração Impala + Kudu.
  • Criação de tabelas Kudu diretamente via SQL no Impala.
  • Operações DML (INSERT, UPDATE, DELETE, UPSERT) via Impala SQL.
  • Consultas analíticas de alto desempenho com predicado pushdown.
  • Integração com HUE para exploração interativa de dados.
  • Particionamento e performance de queries Impala-Kudu.

Apache Kudu e Apache Spark

  • Configuração do conector Kudu para Apache Spark.
  • Leitura e escrita de DataFrames Spark em tabelas Kudu.
  • Uso do Kudu como sink em pipelines de Streaming (Spark Structured Streaming).
  • Otimizações de performance: pushdown de predicados no Spark.
  • Integração com Hive e Metastore para interoperabilidade.

Apache Kudu e Apache NiFi

  • Visão geral do conector NiFi para Kudu.
  • Pipelines de ingestão em tempo real com Apache NiFi.
  • PutKudu Processor: configuração e boas práticas.
  • Tratamento de erros e retry em pipelines NiFi-Kudu.

Monitoramento e Administração

  • Web UI do Kudu Master e Tablet Servers.
  • Métricas de performance e monitoramento via Prometheus e Grafana.
  • Diagnóstico de problemas de replicação e compactação.
  • Backup e recuperação de dados.
  • Tuning de performance: configuração de memória, discos e rede.
  • Segurança: autenticação Kerberos e criptografia TLS.

Carga Horária:

  • 32 Horas de duração.

Modalidades do treinamento

Presencial

Abrimos turmas onde se pode inscrever. Atuamos na maioria das capitais brasileiras.

On Line Ao Vivo

Fazemos a transmissão online do treinamento ao vivo e em tempo real.

In Company

Turmas fechadas para empresas a custo único para até 15 alunos.

Pré-Requisitos:

  • Conhecimento em Banco de Dados e SQL.
  • Noções de Big Data e ecossistema Hadoop.
  • Conhecimento básico de GNU/Linux.
  • Conhecimento em lógica de programação (Java ou Python é um diferencial).

Requisitos:

  • Todos os participantes devem trazer um notebook para realizar as atividades práticas.
  • O Computador deve estar  com acesso de administrador para possibilitar instalações de aplicativos e acesso a Internet.
  • Para Online ter uma boa conectividade com a Internet.
  • Para turmas In-Company não trabalhamos com limite de participantes para os treinamentos, orientamos que as turmas sejam de até 12 alunos para um melhor desempenho.

Requisitos mínimos de hardware

  • Memória RAM : 8GB
  • Espaço em Disco: 20GB
  • Processador: Dual-core AMD 64, EM64T
  • Sistemas Operacionais: GNU/Linux, Windows.
  • VirtualBox.

Material

Serão disponibilizados os seguintes materiais aos alunos do treinamento:

  • Todos os softwares Apache Kudu e acessórios na sua última versão estável.
  • Material próprio em Português do Brasil.
  • Apresentações (slides do treinamento) desenvolvidas pela equipe Ambiente Livre.
  • Apostilas digitais dos softwares desenvolvidas pela Ambiente Livre.
  • Apostilas com exercícios práticos desenvolvidos no treinamento.
  • Materiais e documentações complementares desenvolvido pela Comunidade Open Source Mundial.

Metodologia

  • Todos os dias serão apresentados novos recursos e conceitos e avaliados através de exercícios práticos em todas as aulas.

Estamos localizados em Curitiba e atendemos em todo Brasil com treinamentos Apache Kudu e cursos Apache Kudu. caso necessite de um treinamento customizado com suas necessidades também elaboramos estes treinamentos. solicite proposta comercial.

Diferenciais da Ambiente Livre.

A Ambiente Livre tem 22 anos no mercado, pioneirismo na oferta de consultoria, treinamentos, projetos e suporte em softwares de código-fonte aberto e software livre com um ecossistema voltado a negócios, e pode lhe ajudar a gerir complexidades, reduzir custos, permitindo adaptar e oferecer inovação inteligente necessária para o seu sucesso.

5.007 profissionais capacitados em 399 turmas ministradas.

Atuação global, 845 empresas impactadas em projetos, consultorias e treinamentos no Brasil, América Latina, Europa e África.

Networking entre profissionais, comunidades e startups de tecnologias Open Source e Free Software.

Treinamentos baseados em experiência de projetos e consultorias, 2.980 tutorais documentados, atualizados e disponibilizado de forma vitalícia em EAD.

Empresa 100% focada em Open Source e Free Software e contribuidora com equipe atuante nos projetos e eventos de código aberto e software livre.

Apoio na criação de 4 startups / Spin-off baseadas em soluções Open Source ou Free Software.

Inscrições, Informações e Valores


Instrutor

Marcio Junior Vieira

 
  • 27 anos de experiência em TI, vivência em desenvolvimento e análise de sistemas de gestão empresarial e ciência de dados.
  • CEO da Ambiente Livre atuando como Cientista de Dados, Engenheiro de Dados e Arquiteto de Software.
  • Atuou como Professor dos MBAs em Big Data & Data Science, Inteligência Artificial e Business Intelligence da Universidade Positivo e do MBA Artificial Intelligence e Machine Learning da FIAP.
  • Atuou como Pesquisador pelo UFG/CIAP (Centro de Colaboração Interinstitucional de Inteligência Artificial Aplicada às Políticas Públicas) e no grupo Latitude (Laboratório de Tecnologias da Tomada de Decisão) da UNB.
  • Trabalhando com Free Software e Open Source desde 2000 com serviços de consultoria e treinamento.
  • Graduado em Tecnologia em Informática (2004) e pós-graduado em Software Livre (2005) ambos pela UFPR.
  • Palestrante FLOSS em: The Developers Conference (TDC), FISL, Latinoware, Campus Party, Pentaho Day, Ticnova, PGConf Brasil e FTSL.
  • Organizador Geral: Pentaho Day 2017, 2015, 2019 e apoio nas edições de 2013 e 2014.
  • Data Scientist, instrutor e consultor de Big Data e Data Science com tecnologias abertas.
  • Ajudou a capacitar equipes de Big Data na IBM, Accenture, Tivit, Serpro, Natura, MP, Netshoes, Embraer entre outras.
  • Especialista em implantação e customização de Big Data com Hadoop, Spark, Pentaho, Cassandra e Kafka.
  • Contribuidor de projetos Open Source ou Free Software internacionais, tais como Pentaho, LimeSurvey, SuiteCRM, Camunda, Operaton e Apache Hop.
  • Especialista em implantação e customização de ECM com Alfresco e BPM com Activiti, Flowable, Camunda e Operaton.
  • Certificado (Certified Pentaho Solutions) pela Hitachi Vantara (Pentaho inc).

Log in