Treinamento Apache Kudu
Sobre o Treinamento
O treinamento Apache Kudu é voltado para profissionais de Big Data e Engenharia de Dados que precisam de um armazenamento colunar de alta performance para suportar cargas de trabalho analíticas e de baixa latência simultaneamente. O Apache Kudu foi projetado para preencher a lacuna entre os sistemas de armazenamento HDFS, otimizados para leitura, e os bancos NoSQL, otimizados para escrita, oferecendo mutabilidade em tempo real combinada com desempenho analítico compatível com o ecossistema Hadoop.
Neste treinamento o aluno aprenderá a arquitetura interna do Kudu, os conceitos de tablet servers, masters, particionamento de tabelas e compactação, além de integrar o Kudu com Apache Impala e Apache Spark para consultas analíticas de alta velocidade. Serão exploradas APIs de acesso direto (Java e Python), estratégias de particionamento por range e hash, monitoramento de clusters e boas práticas de deploy.
O que vou aprender?
Ao final deste treinamento você será capaz de:
- Compreender a arquitetura interna do Apache Kudu: Masters, Tablet Servers e replicação via Raft Consensus.
- Modelar tabelas com particionamento por Hash, Range e combinado para alta performance de leitura e escrita.
- Instalar e configurar um cluster Kudu standalone e multi-nó, inclusive integrado ao Cloudera Manager.
- Realizar operações CRUD (Insert, Upsert, Update, Delete) via API Java e API Python.
- Criar e consultar tabelas Kudu diretamente com SQL usando o Apache Impala.
- Construir pipelines de ingestão em tempo real com Apache Spark Structured Streaming gravando em Kudu.
- Integrar o Apache NiFi ao Kudu para fluxos de dados de alta vazão com o PutKudu Processor.
- Monitorar e administrar o cluster Kudu com a Web UI, Prometheus e Grafana.
- Aplicar segurança no cluster com autenticação Kerberos e criptografia TLS.
- Identificar e corrigir problemas de replicação, compactação e performance.
Dificuldade: Intermediário / Avançado.
Aplicabilidade: Este treinamento foi desenvolvido usando o Apache Kudu 1.18.1 e foi modificado pela última vez em 13 de Julho de 2026.
Conteúdo Programático.
Conceitual Big Data e Armazenamento Colunar
- Visão geral sobre Hadoop e o ecossistema de armazenamento.
- Características e limitações do HDFS para cargas OLTP.
- Comparativo: HBase X Kudu X Cassandra X Parquet.
- Histórico e motivação do Apache Kudu.
- Casos de uso do Kudu no mercado.
- Empresas usando Kudu no mundo e no Brasil.
- Posição do Kudu no ecossistema Cloudera
Arquitetura do Apache Kudu
- Componentes: Kudu Master e Tablet Servers.
- Tablets e particionamento de dados.
- Modelo de dados: chaves primárias, colunas e tipos suportados.
- Replicação e tolerância a falhas (Raft Consensus).
- Compactação de dados e gerenciamento de memória (MemRowSet vs. DiskRowSet).
- Redes e balanceamento de carga entre tablets.
Instalação e Configuração do Apache Kudu
- Requisitos de sistema e hardware para produção.
- Instalação standalone para desenvolvimento e testes.
- Configuração em cluster multi-nó.
- Integração com Cloudera Manager.
- Configuração de replicação e número de réplicas.
- Gerenciamento de tabelas via Kudu CLI e Web UI.
- Deploy com Docker e Kubernetes.
Modelagem de Dados no Apache Kudu
- Criação de schemas e definição de chaves primárias.
- Estratégias de particionamento: Hash Partitioning e Range Partitioning.
- Particionamento composto (Hash + Range).
- Boas práticas de modelagem para alta performance de escrita e leitura.
- Alteração de schemas em tabelas existentes.
- Limitações de design e anti-padrões.
API Java do Apache Kudu
- Configuração do ambiente de desenvolvimento Java com Maven.
- KuduClient: conexão e gerenciamento de sessões.
- Operações DML: Insert, Upsert, Update, Delete.
- Leitura de dados: KuduScanner e predicados de filtro.
- Controle de fluxo e FlushMode.
- Tratamento de erros e retry policies.
API Python do Apache Kudu
- Instalação e configuração do cliente Python.
- Conexão ao cluster Kudu via Python API.
- Operações CRUD com Python.
- Integração com Pandas para análise de dados.
- Casos práticos de ingestão de dados em tempo real.
Apache Kudu e Apache Impala
- Visão geral da integração Impala + Kudu.
- Criação de tabelas Kudu diretamente via SQL no Impala.
- Operações DML (INSERT, UPDATE, DELETE, UPSERT) via Impala SQL.
- Consultas analíticas de alto desempenho com predicado pushdown.
- Integração com HUE para exploração interativa de dados.
- Particionamento e performance de queries Impala-Kudu.
Apache Kudu e Apache Spark
- Configuração do conector Kudu para Apache Spark.
- Leitura e escrita de DataFrames Spark em tabelas Kudu.
- Uso do Kudu como sink em pipelines de Streaming (Spark Structured Streaming).
- Otimizações de performance: pushdown de predicados no Spark.
- Integração com Hive e Metastore para interoperabilidade.
Apache Kudu e Apache NiFi
- Visão geral do conector NiFi para Kudu.
- Pipelines de ingestão em tempo real com Apache NiFi.
- PutKudu Processor: configuração e boas práticas.
- Tratamento de erros e retry em pipelines NiFi-Kudu.
Monitoramento e Administração
- Web UI do Kudu Master e Tablet Servers.
- Métricas de performance e monitoramento via Prometheus e Grafana.
- Diagnóstico de problemas de replicação e compactação.
- Backup e recuperação de dados.
- Tuning de performance: configuração de memória, discos e rede.
- Segurança: autenticação Kerberos e criptografia TLS.
Carga Horária:
- 32 Horas de duração.
Modalidades do treinamento
Presencial
Abrimos turmas onde se pode inscrever. Atuamos na maioria das capitais brasileiras.
On Line Ao Vivo
Fazemos a transmissão online do treinamento ao vivo e em tempo real.
In Company
Turmas fechadas para empresas a custo único para até 15 alunos.
Pré-Requisitos:
- Conhecimento em Banco de Dados e SQL.
- Noções de Big Data e ecossistema Hadoop.
- Conhecimento básico de GNU/Linux.
- Conhecimento em lógica de programação (Java ou Python é um diferencial).
Requisitos:
- Todos os participantes devem trazer um notebook para realizar as atividades práticas.
- O Computador deve estar com acesso de administrador para possibilitar instalações de aplicativos e acesso a Internet.
- Para Online ter uma boa conectividade com a Internet.
- Para turmas In-Company não trabalhamos com limite de participantes para os treinamentos, orientamos que as turmas sejam de até 12 alunos para um melhor desempenho.
Requisitos mínimos de hardware
- Memória RAM : 8GB
- Espaço em Disco: 20GB
- Processador: Dual-core AMD 64, EM64T
- Sistemas Operacionais: GNU/Linux, Windows.
- VirtualBox.
Material
Serão disponibilizados os seguintes materiais aos alunos do treinamento:
- Todos os softwares Apache Kudu e acessórios na sua última versão estável.
- Material próprio em Português do Brasil.
- Apresentações (slides do treinamento) desenvolvidas pela equipe Ambiente Livre.
- Apostilas digitais dos softwares desenvolvidas pela Ambiente Livre.
- Apostilas com exercícios práticos desenvolvidos no treinamento.
- Materiais e documentações complementares desenvolvido pela Comunidade Open Source Mundial.
Metodologia
- Todos os dias serão apresentados novos recursos e conceitos e avaliados através de exercícios práticos em todas as aulas.
Estamos localizados em Curitiba e atendemos em todo Brasil com treinamentos Apache Kudu e cursos Apache Kudu. caso necessite de um treinamento customizado com suas necessidades também elaboramos estes treinamentos. solicite proposta comercial.
Diferenciais da Ambiente Livre.
A Ambiente Livre tem 22 anos no mercado, pioneirismo na oferta de consultoria, treinamentos, projetos e suporte em softwares de código-fonte aberto e software livre com um ecossistema voltado a negócios, e pode lhe ajudar a gerir complexidades, reduzir custos, permitindo adaptar e oferecer inovação inteligente necessária para o seu sucesso.
5.007 profissionais capacitados em 399 turmas ministradas.
Atuação global, 845 empresas impactadas em projetos, consultorias e treinamentos no Brasil, América Latina, Europa e África.
Networking entre profissionais, comunidades e startups de tecnologias Open Source e Free Software.
Treinamentos baseados em experiência de projetos e consultorias, 2.980 tutorais documentados, atualizados e disponibilizado de forma vitalícia em EAD.
Empresa 100% focada em Open Source e Free Software e contribuidora com equipe atuante nos projetos e eventos de código aberto e software livre.
Apoio na criação de 4 startups / Spin-off baseadas em soluções Open Source ou Free Software.
Inscrições, Informações e Valores
Instrutor
Marcio Junior Vieira
- 27 anos de experiência em TI, vivência em desenvolvimento e análise de sistemas de gestão empresarial e ciência de dados.
- CEO da Ambiente Livre atuando como Cientista de Dados, Engenheiro de Dados e Arquiteto de Software.
- Atuou como Professor dos MBAs em Big Data & Data Science, Inteligência Artificial e Business Intelligence da Universidade Positivo e do MBA Artificial Intelligence e Machine Learning da FIAP.
- Atuou como Pesquisador pelo UFG/CIAP (Centro de Colaboração Interinstitucional de Inteligência Artificial Aplicada às Políticas Públicas) e no grupo Latitude (Laboratório de Tecnologias da Tomada de Decisão) da UNB.
- Trabalhando com Free Software e Open Source desde 2000 com serviços de consultoria e treinamento.
- Graduado em Tecnologia em Informática (2004) e pós-graduado em Software Livre (2005) ambos pela UFPR.
- Palestrante FLOSS em: The Developers Conference (TDC), FISL, Latinoware, Campus Party, Pentaho Day, Ticnova, PGConf Brasil e FTSL.
- Organizador Geral: Pentaho Day 2017, 2015, 2019 e apoio nas edições de 2013 e 2014.
- Data Scientist, instrutor e consultor de Big Data e Data Science com tecnologias abertas.
- Ajudou a capacitar equipes de Big Data na IBM, Accenture, Tivit, Serpro, Natura, MP, Netshoes, Embraer entre outras.
- Especialista em implantação e customização de Big Data com Hadoop, Spark, Pentaho, Cassandra e Kafka.
- Contribuidor de projetos Open Source ou Free Software internacionais, tais como Pentaho, LimeSurvey, SuiteCRM, Camunda, Operaton e Apache Hop.
- Especialista em implantação e customização de ECM com Alfresco e BPM com Activiti, Flowable, Camunda e Operaton.
- Certificado (Certified Pentaho Solutions) pela Hitachi Vantara (Pentaho inc).