Quanto custa um minuto fora do ar: os engenheiros invisíveis que mantêm o Pix, o cartão e o e-commerce funcionando
Com mais de 7 bilhões de transações Pix em um único mês e 133 milhões de pagamentos com cartões por dia, Paulo Renan, com experiência em Command Center, SRE e arquitetura de dados, analisa o trabalho realizado antes, durante e depois de uma falha
Reprodução A maquininha recusa o pagamento, o aplicativo bancário deixa de responder e a compra on-line para no momento da autorização. Para quem está diante da tela, o efeito é imediato. Nos bastidores, porém, a interrupção pode envolver aplicações, integrações, redes, bancos de dados e empresas diferentes.
A escala dos meios digitais ajuda a entender por que poucos minutos de instabilidade podem atingir milhares de pessoas e negócios. Em maio de 2026, segundo as estatísticas do Banco Central, o Pix superou 7 bilhões de transações e movimentou mais de R$ 3 trilhões. Mais de 170 milhões de pessoas físicas, equivalentes a aproximadamente 80% da população brasileira, já haviam utilizado o sistema.
Nos cartões, a Associação Brasileira das Empresas de Cartões de Crédito e Serviços (Abecs) registrou 23,9 bilhões de transações no primeiro semestre de 2026, média de 133 milhões por dia e movimentação de R$ 2,3 trilhões. Compras pela internet e por outros canais remotos responderam por R$ 633 bilhões entre janeiro e junho, crescimento de 18% em relação ao mesmo período do ano anterior.
Pix, cartões e plataformas de comércio eletrônico não percorrem a mesma infraestrutura e seguem arquiteturas e regras próprias. Em comum, há uma expectativa: a operação precisa ser concluída em segundos, apesar da complexidade técnica que sustenta cada etapa.
O minuto parado não tem preço único
Não existe uma tabela universal para calcular o custo de um minuto de indisponibilidade. Para um pequeno comércio, a consequência pode ser uma venda adiada. Em uma plataforma que processa milhares de solicitações por segundo, o impacto pode incluir transações recusadas, perda de receita, atendimento extraordinário, penalidades contratuais e desgaste na relação com o cliente.
Um levantamento global do Uptime Institute ajuda a dimensionar as ocorrências mais graves. Na edição de 2026 de sua análise anual sobre interrupções de TI e data centers, 57% dos participantes afirmaram que o incidente relevante mais recente custou mais de US$ 100 mil. Um em cada cinco relatou valor superior a US$ 1 milhão, e aproximadamente uma em cada dez interrupções foi classificada como séria ou severa.
Os dados não são específicos do Brasil nem do mercado de pagamentos e, por isso, não permitem estimar um valor médio por minuto. O cálculo depende do volume processado, do valor das transações, da duração da instabilidade, das alternativas disponíveis, dos contratos de nível de serviço e do esforço necessário para normalizar o ambiente. Há ainda perdas menos visíveis, como o abandono da compra e a redução da confiança do usuário.
O trabalho percebido quando o sistema falha
É nesse cenário que a trajetória do arquiteto de sistemas Paulo Renan dos Santos Ferrari Bessa ganha relevância. Ele atuou em um Command Center noturno, monitorando ambientes críticos da Alelo por meio da Claranet; depois, trabalhou como SRE em um projeto ligado à processadora de pagamentos Getnet, pela Oraex. Na Semantix, participou como arquiteto de plataformas de dados em projetos para Fiserv e SPC Brasil.

Paulo Renan dos Santos Ferrari Bessa.
Esse percurso reúne três etapas da confiabilidade operacional: acompanhamento contínuo, resposta de engenharia e arquitetura de plataformas que sustentam dados utilizados por organizações financeiras e de crédito. A disciplina de SRE, sigla para Site Reliability Engineering, aplica métodos de engenharia de software à operação para preservar disponibilidade, desempenho, capacidade e tempo de resposta.
Observabilidade além das telas
Centros de operação costumam ser associados a paredes cobertas por monitores. O desafio surge quando a quantidade de sinais supera a capacidade humana de distinguir o que exige ação imediata. Monitoramento e observabilidade estão relacionados, mas não são equivalentes: o primeiro verifica condições previamente definidas; a segunda reúne elementos para compreender por que o ambiente se comporta de determinada maneira, inclusive diante de falhas ainda desconhecidas.
A documentação do OpenTelemetry aponta métricas, registros de eventos e rastreamentos distribuídos entre os principais sinais usados nessa investigação. Em conjunto, eles permitem acompanhar uma solicitação por diferentes componentes e localizar o ponto em que a degradação começou.
“Monitorar é perceber que algo saiu do padrão. Observabilidade é conseguir investigar onde a falha começou, quais componentes foram afetados e o que precisa ser priorizado. Em um sistema de pagamentos, o aplicativo pode estar disponível e, ainda assim, a transação não ser concluída porque uma dependência essencial deixou de responder”, explica Paulo Renan.
Entre as iniciativas citadas em seu histórico está uma proposta de centralização de alertas com OpsGenie, concebida para reduzir a dependência de analistas acompanhando várias telas simultaneamente durante a madrugada. A documentação disponível descreve a iniciativa como proposta e não registra resultados posteriores de implantação.
Como funciona uma “war room”
Quando um incidente tem grande impacto ou elevada complexidade, equipes diferentes podem ser reunidas em uma sala física ou virtual de resposta, conhecida informalmente como war room. O objetivo não é acumular pessoas na chamada, mas organizar a atuação, registrar decisões e manter a comunicação enquanto a área técnica trabalha na contenção.
O manual de SRE do Google estrutura esse processo em torno de coordenação, operação e comunicação. Com responsabilidades definidas, a equipe pode investigar o incidente, aplicar medidas de recuperação e atualizar as áreas envolvidas sem interromper continuamente os profissionais encarregados da correção.
“Em uma war room, todos precisam saber quem coordena, quem investiga, quem executa e quem comunica. Reunir muitas pessoas sem responsabilidades definidas pode aumentar o ruído e atrasar a recuperação. Durante uma ocorrência crítica, organização é tão importante quanto conhecimento técnico”, diz Paulo.
A primeira meta nem sempre é identificar de imediato a causa definitiva. Quando há impacto para usuários, pode ser necessário reverter uma mudança, isolar um componente, ativar uma contingência ou reduzir temporariamente uma funcionalidade. A investigação aprofundada continua depois que o ambiente recupera estabilidade.
Confiabilidade como continuidade dos negócios
Os volumes do Pix, dos cartões e das compras remotas mostram que os meios digitais deixaram de ser apenas uma conveniência. Uma instabilidade pode impedir vendas, atrasar transferências, bloquear assinaturas e afetar quem depende do recebimento para manter a própria atividade.
Nesse contexto, observabilidade, engenharia de confiabilidade e gestão de incidentes não são assuntos restritos aos departamentos de tecnologia. O profissional que evita uma interrupção raramente é percebido pelo consumidor; o mesmo ocorre quando uma equipe restaura o serviço antes que o impacto se amplie. Em uma economia que realiza centenas de milhões de transações por dia, essa atuação silenciosa tornou-se parte da continuidade dos negócios.




COMENTÁRIOS