Soluções para a Convergência entre Computação de Alto Desempenho e Computação em Nuvem

DSpace Repository

A- A A+

Soluções para a Convergência entre Computação de Alto Desempenho e Computação em Nuvem

Show simple item record

dc.contributor Universidade Federal de Santa Catarina pt_BR
dc.contributor.advisor Castro, Márcio Bastos
dc.contributor.author Soda, Artur Luiz Rizzato Toru
dc.date.accessioned 2026-09-01T18:32:42Z
dc.date.available 2026-09-01T18:32:42Z
dc.date.issued 2026-09-01
dc.identifier.uri https://repositorio.ufsc.br/handle/123456789/275284
dc.description Tecnologia e inovação pt_BR
dc.description.abstract Instâncias spot da AWS oferecem descontos de até 90% em relação ao preço convencional, mas podem ser revogadas a qualquer momento com apenas dois minutos de aviso, descartando todo o progresso acumulado por aplicações MPI de longa duração. Modificar aplicações científicas legadas para lidar explicitamente com falhas raramente é viável, deixando a maioria dos códigos sem qualquer resiliência frente a revogações. Diante disso, este trabalho integra o MANA, um sistema de Checkpoint/Restart transparente e independente de rede para aplicações MPI, ao orquestrador HPC@Cloud, automatizando o ciclo completo de recuperação sem exigir alterações no código da aplicação. Ao detectar um aviso de revogação, o sistema salva o estado de todos os processos e retoma a execução por uma de duas estratégias: a Replace, que provisiona um novo nó para restaurar a capacidade original do cluster, e a Degraded, que reinicia imediatamente nos nós sobreviventes com paralelismo reduzido. A avaliação foi conduzida com 282 execuções sobre os npb CG-C, EP-D e LU-C em clusters de 2, 4 e 8 workers. Os resultados mostram que o desempenho da recuperação é governado por dois fatores combinados: tamanho do cluster e momento da falha. A Degraded torna-se progressivamente vantajosa conforme o cluster cresce; a Replace permanece preferível em clusters pequenos com falhas no início da execução. Economicamente, o desconto das instâncias spot compensa o overhead do MANA em jobs de duração moderada a longa, estabelecendo limiares práticos de viabilidade para o uso de Checkpoint/Restart transparente em infraestrutura spot. pt_BR
dc.format.extent Resumo + Vídeo; pt_BR
dc.language.iso por pt_BR
dc.publisher Florianopolis, SC pt_BR
dc.subject Computação em Nuvem pt_BR
dc.subject Computação de Alto Desempenho pt_BR
dc.subject Tolerância a Falhas pt_BR
dc.subject HPC@Cloud pt_BR
dc.subject Instâncias Spot pt_BR
dc.title Soluções para a Convergência entre Computação de Alto Desempenho e Computação em Nuvem pt_BR
dc.type video pt_BR


Files in this item

Files Size Format View Description
videosic.mp4 17.09Mb MPEG-4 video View/Open Seminário de Iniciação Científica e Tecnológica; Universidade Federal de Santa Catarina; Centro Tecnológico (CTC); Ciências da Computação;

This item appears in the following Collection(s)

Show simple item record

Search DSpace


Browse

My Account

Statistics

Compartilhar