Replicação Lógica + Patroni/HA: o problema do failover
Guilherme Barreto
Timbira
Em um failover, o líder mudar, esse líder não terá o slot de replicação lógica original. O que fazer para garantir que a replicação siga funcionando?
Replicação Lógica + Patroni/HA: o problema do failover
A combinação entre replicação lógica e alta disponibilidade tornou-se cada vez mais comum em arquiteturas PostgreSQL modernas, especialmente em cenários de integração entre ambientes, multi-tenant, CDC, ETL e distribuição de dados entre aplicações. Entretanto, existe um problema crítico frequentemente ignorado em projetos de HA: os slots de replicação lógica não são replicados entre os nós do cluster.
Na prática, isso significa que um failover automatizado realizado pelo Patroni pode interromper completamente a replicação lógica, gerar gaps de WAL e, em casos mais graves, causar inconsistências ou perda de continuidade na sincronização de dados.
Nesta palestra, será apresentado de forma técnica e prática como o PostgreSQL trata slots lógicos internamente, por que o problema acontece durante promoções de standby e quais são os impactos reais em ambientes produtivos. Também serão demonstradas as principais estratégias atualmente utilizadas para mitigar esse cenário, incluindo o uso da extensão pg_failover_slots, automações via callbacks do Patroni e abordagens tolerantes a inconsistência controlada.
A apresentação abordará:
* funcionamento interno dos slots de replicação lógica;
* interação entre streaming replication e replicação lógica;
* comportamento do Patroni durante failover;
* riscos de perda de WAL e gaps de replicação;
* implementação do pg_failover_slots;
* automação de recriação de slots pós-failover;
* estratégias resilientes para subscribers;
* boas práticas de observabilidade e operação.
O objetivo é fornecer uma visão aprofundada sobre um dos principais desafios arquiteturais em ambientes PostgreSQL de alta disponibilidade, trazendo exemplos reais, fluxos operacionais e recomendações práticas para produção.
Replicação Lógica + Patroni/HA: o problema do failover
Guilherme Barreto
Timbira
Em um failover, o líder mudar, esse líder não terá o slot de replicação lógica original. O que fazer para garantir que a replicação siga funcionando?
Replicação Lógica + Patroni/HA: o problema do failover
A combinação entre replicação lógica e alta disponibilidade tornou-se cada vez mais comum em arquiteturas PostgreSQL modernas, especialmente em cenários de integração entre ambientes, multi-tenant, CDC, ETL e distribuição de dados entre aplicações. Entretanto, existe um problema crítico frequentemente ignorado em projetos de HA: os slots de replicação lógica não são replicados entre os nós do cluster.
Na prática, isso significa que um failover automatizado realizado pelo Patroni pode interromper completamente a replicação lógica, gerar gaps de WAL e, em casos mais graves, causar inconsistências ou perda de continuidade na sincronização de dados.
Nesta palestra, será apresentado de forma técnica e prática como o PostgreSQL trata slots lógicos internamente, por que o problema acontece durante promoções de standby e quais são os impactos reais em ambientes produtivos. Também serão demonstradas as principais estratégias atualmente utilizadas para mitigar esse cenário, incluindo o uso da extensão pg_failover_slots, automações via callbacks do Patroni e abordagens tolerantes a inconsistência controlada.
A apresentação abordará:
* funcionamento interno dos slots de replicação lógica;
* interação entre streaming replication e replicação lógica;
* comportamento do Patroni durante failover;
* riscos de perda de WAL e gaps de replicação;
* implementação do pg_failover_slots;
* automação de recriação de slots pós-failover;
* estratégias resilientes para subscribers;
* boas práticas de observabilidade e operação.
O objetivo é fornecer uma visão aprofundada sobre um dos principais desafios arquiteturais em ambientes PostgreSQL de alta disponibilidade, trazendo exemplos reais, fluxos operacionais e recomendações práticas para produção.