Soluções para a Convergência entre Computação de Alto Desempenho e Computação em Nuvem
Show simple item record
| dc.contributor |
Universidade Federal de Santa Catarina |
pt_BR |
| dc.contributor.advisor |
Castro, Márcio Bastos |
|
| dc.contributor.author |
Soda, Artur Luiz Rizzato Toru |
|
| dc.date.accessioned |
2026-09-01T18:32:42Z |
|
| dc.date.available |
2026-09-01T18:32:42Z |
|
| dc.date.issued |
2026-09-01 |
|
| dc.identifier.uri |
https://repositorio.ufsc.br/handle/123456789/275284 |
|
| dc.description |
Tecnologia e inovação |
pt_BR |
| dc.description.abstract |
Instâncias spot da AWS oferecem descontos de até 90% em relação ao preço convencional, mas podem ser revogadas a qualquer momento com apenas dois minutos de aviso, descartando todo o progresso acumulado por aplicações MPI de longa duração. Modificar aplicações científicas legadas para lidar explicitamente com falhas raramente é viável, deixando a maioria dos códigos sem qualquer resiliência frente a revogações. Diante disso, este trabalho integra o MANA, um sistema de Checkpoint/Restart transparente e independente de rede para aplicações MPI, ao orquestrador HPC@Cloud, automatizando o ciclo completo de recuperação sem exigir alterações no código da aplicação. Ao detectar um aviso de revogação, o sistema salva o estado de todos os processos e retoma a execução por uma de duas estratégias: a Replace, que provisiona um novo nó para restaurar a capacidade original do cluster, e a Degraded, que reinicia imediatamente nos nós sobreviventes com paralelismo reduzido. A avaliação foi conduzida com 282 execuções sobre os npb CG-C, EP-D e LU-C em clusters de 2, 4 e 8 workers. Os resultados mostram que o desempenho da recuperação é governado por dois fatores combinados: tamanho do cluster e momento da falha. A Degraded torna-se progressivamente vantajosa conforme o cluster cresce; a Replace permanece preferível em clusters pequenos com falhas no início da execução. Economicamente, o desconto das instâncias spot compensa o overhead do MANA em jobs de duração moderada a longa, estabelecendo limiares práticos de viabilidade para o uso de Checkpoint/Restart transparente em infraestrutura spot. |
pt_BR |
| dc.format.extent |
Resumo + Vídeo; |
pt_BR |
| dc.language.iso |
por |
pt_BR |
| dc.publisher |
Florianopolis, SC |
pt_BR |
| dc.subject |
Computação em Nuvem |
pt_BR |
| dc.subject |
Computação de Alto Desempenho |
pt_BR |
| dc.subject |
Tolerância a Falhas |
pt_BR |
| dc.subject |
HPC@Cloud |
pt_BR |
| dc.subject |
Instâncias Spot |
pt_BR |
| dc.title |
Soluções para a Convergência entre Computação de Alto Desempenho e Computação em Nuvem |
pt_BR |
| dc.type |
video |
pt_BR |
Files in this item
|
videosic.mp4
|
17.09Mb |
MPEG-4 video |
View/Open
|
Seminário de Iniciação Científica e Tecnológica; Universidade Federal de Santa Catarina; Centro Tecnológico (CTC); Ciências da Computação; |
This item appears in the following Collection(s)
Show simple item record
Search DSpace
Browse
-
All of DSpace
-
This Collection
My Account
Statistics
Compartilhar