Soluções para a Convergência entre Computação de Alto Desempenho e Computação em Nuvem
Author:
Soda, Artur Luiz Rizzato Toru
Abstract:
Instâncias spot da AWS oferecem descontos de até 90% em relação ao preço convencional, mas podem ser revogadas a qualquer momento com apenas dois minutos de aviso, descartando todo o progresso acumulado por aplicações MPI de longa duração. Modificar aplicações científicas legadas para lidar explicitamente com falhas raramente é viável, deixando a maioria dos códigos sem qualquer resiliência frente a revogações. Diante disso, este trabalho integra o MANA, um sistema de Checkpoint/Restart transparente e independente de rede para aplicações MPI, ao orquestrador HPC@Cloud, automatizando o ciclo completo de recuperação sem exigir alterações no código da aplicação. Ao detectar um aviso de revogação, o sistema salva o estado de todos os processos e retoma a execução por uma de duas estratégias: a Replace, que provisiona um novo nó para restaurar a capacidade original do cluster, e a Degraded, que reinicia imediatamente nos nós sobreviventes com paralelismo reduzido. A avaliação foi conduzida com 282 execuções sobre os npb CG-C, EP-D e LU-C em clusters de 2, 4 e 8 workers. Os resultados mostram que o desempenho da recuperação é governado por dois fatores combinados: tamanho do cluster e momento da falha. A Degraded torna-se progressivamente vantajosa conforme o cluster cresce; a Replace permanece preferível em clusters pequenos com falhas no início da execução. Economicamente, o desconto das instâncias spot compensa o overhead do MANA em jobs de duração moderada a longa, estabelecendo limiares práticos de viabilidade para o uso de Checkpoint/Restart transparente em infraestrutura spot.