18 de março de 2022

Construindo em Confiabilidade e Durabilidade na Datto

Por Bob Petrocelli
Backup e RecuperaçãoVisão geral dos recursosDatto SIRIS

Quando vendi minha segunda startup (uma empresa de software de armazenamento centrada em ZFS) para a Oracle em 2014, sentei-me para tomar um café com o EVP da Oracle que dirigia a divisão de sistemas (a antiga Sun Microsystems). Ele compartilhou a seguinte opinião: "Há duas tecnologias que são impossíveis de serem perfeitamente corretas: CPUs e armazenamento". Acredito que, de uma certa perspectiva, ele estava certo. Por quê? Em poucas palavras, à medida que você diminui o tamanho do processo da CPU ou aumenta os dispositivos de armazenamento, as leis da física quântica - que regem o funcionamento do hardware - começam a introduzir erros.

Nas CPUs, você pode obter efeitos de tunelamento quântico que fazem com que as portas lógicas falhem e, no armazenamento, você obtém UBER (taxas de erro de bit incorrigíveis). No caso dos próprios dispositivos de armazenamento, a UBER (cerca de 1×10-15) permaneceu constante, mesmo com o aumento das capacidades em ordens de magnitude. Em suma, a perda de dados é uma certeza com tempo suficiente - o segredo, é claro, é projetar sistemas que gerenciem ativamente os dispositivos de armazenamento de modo que o MTTDL (tempo médio para perda de dados) seja maior que a vida útil dos dados.

Na Datto, gerenciamos ativamente o armazenamento para que a durabilidade dos dados (pense nisso como o inverso do MTTDL) ou a probabilidade de perda de dados anualmente seja medida em 9 (mais 9 é melhor). Na Datto, buscamos atingir (dependendo do aplicativo) entre 6 e 11 9's de durabilidade de dados na nuvem e cerca de 5 9's na borda (a frota de dispositivos Siris). Sem nos aprofundarmos muito na matemática, esperamos que a durabilidade dos dados exceda a maioria das políticas de retenção racionais.

Podemos fazer o backtesting disso - e não tivemos nenhum incidente conhecido de perda irrecuperável de dados devido a falhas de sistema na nuvem (cerca de 1,6EB) nos últimos 24 meses.

Mas isso é apenas metade da história. Os dados são inúteis se você não puder acessá-los. A segunda consideração em nossa arquitetura de nuvem é a disponibilidade. Internamente, às vezes nos referimos a isso como raio de explosão. Projetamos nossa infraestrutura crítica para ser livre de pontos únicos de falha – mas múltiplas falhas podem ocorrer, e ocorrem. Quando isso acontece, um sistema bem projetado terá um modo de falha que limita a interrupção do serviço a um nível predefinido. No caso de BCDR (Continuidade de Negócios e Recuperação de Desastres), a falha total de um nó da nuvem interromperia o acesso à nuvem para cerca de 0,026% dos agentes de BCDR. É claro que isso não inclui a frota de edge computing, que fornece a réplica primária para operações típicas de continuidade de negócios.

Na Datto, temos um ditado: "Fazer backup é fácil, restaurar é difícil". As operações e o armazenamento em nuvem estão em nosso DNA e estamos, como sempre, comprometidos com a melhoria contínua para nossos parceiros e seus clientes.

Sugestões para as próximas leituras