PostgreSQL: do transacional ao analítico com Iceberg e Athena
Mariana Mercier
Creditas
Use CDC via WAL para criar um Data Lakehouse com Iceberg e Athena: uma arquitetura moderna de analytics sem sobrecarregar o banco de produção.
PostgreSQL é frequentemente utilizado como sistema de registro de aplicações críticas, suportando workloads transacionais com alta confiabilidade. No entanto, à medida que a necessidade de análise de dados cresce, é comum que relatórios, dashboards e consultas exploratórias passem a ser executados diretamente no banco de produção.
Essa mistura de workloads transacionais e analíticos pode gerar aumento de latência, consumo elevado de I/O e impacto direto na experiência da aplicação.
Nesta palestra apresento uma arquitetura que permite utilizar dados do PostgreSQL para analytics em larga escala sem sobrecarregar o banco transacional. A abordagem utiliza Change Data Capture (CDC) para capturar mudanças registradas no WAL do PostgreSQL e replicá-las continuamente para um Data Lake em S3.
Os dados são organizados como tabelas Apache Iceberg, permitindo evolução de schema, versionamento e gerenciamento eficiente de dados. A camada analítica é implementada com Amazon Athena, possibilitando consultas SQL diretamente sobre o Data Lake de forma serverless.
Durante a sessão também discutiremos desafios práticos dessa arquitetura, como latência de CDC, mudanças de schema, gerenciamento de partições e o problema de pequenos arquivos em Data Lakes.
Ao final da palestra, os participantes terão uma visão clara de como utilizar dados transacionais do PostgreSQL para alimentar workloads analíticos modernos, preservando a estabilidade e performance do banco de produção.
PostgreSQL: do transacional ao analítico com Iceberg e Athena
Mariana Mercier
Creditas
Use CDC via WAL para criar um Data Lakehouse com Iceberg e Athena: uma arquitetura moderna de analytics sem sobrecarregar o banco de produção.
PostgreSQL é frequentemente utilizado como sistema de registro de aplicações críticas, suportando workloads transacionais com alta confiabilidade. No entanto, à medida que a necessidade de análise de dados cresce, é comum que relatórios, dashboards e consultas exploratórias passem a ser executados diretamente no banco de produção.
Essa mistura de workloads transacionais e analíticos pode gerar aumento de latência, consumo elevado de I/O e impacto direto na experiência da aplicação.
Nesta palestra apresento uma arquitetura que permite utilizar dados do PostgreSQL para analytics em larga escala sem sobrecarregar o banco transacional. A abordagem utiliza Change Data Capture (CDC) para capturar mudanças registradas no WAL do PostgreSQL e replicá-las continuamente para um Data Lake em S3.
Os dados são organizados como tabelas Apache Iceberg, permitindo evolução de schema, versionamento e gerenciamento eficiente de dados. A camada analítica é implementada com Amazon Athena, possibilitando consultas SQL diretamente sobre o Data Lake de forma serverless.
Durante a sessão também discutiremos desafios práticos dessa arquitetura, como latência de CDC, mudanças de schema, gerenciamento de partições e o problema de pequenos arquivos em Data Lakes.
Ao final da palestra, os participantes terão uma visão clara de como utilizar dados transacionais do PostgreSQL para alimentar workloads analíticos modernos, preservando a estabilidade e performance do banco de produção.