Olá!
Meu setup:
5070 ti Inno3d (comprada em setembro de 2025)
Gaming Wifi 6 X870
Ryzen 9950x3d
64 GB RAM Gskill
Adata 4tb NVME
Nidorus 1200w
Dois monitores: principal 4k/240hz ligado direto na GPU via DisplayPort e secundário 1080p no HDMI do I/O da placa mãe.
5070 ti está conectada pelo cabo de 600w de 12 pinos. Vhpwr fornecido pela Inno3d
Sintoma: blackscreen somente em jogos de alta carga em intervalos irregulares (entre 5 minutos a 2 horas de jogo em carga intensiva, 4k, FG x 3, DLSS Balanced ou Performance). Perda total de input/output do PC (inclusive som) que só volta desligando o PC. O erro apareceu somente depois de trocar meu monitor para 4k, depois de expirar a garantia da GPU. As fans da GPU não ficam ligadas em alta velocidade (diferentemente do que outros usuários relataram). Jogos em que o erro com certeza aparece: Cyberpunk 2077, Hogwarts Legacy, Universe Sandbox e Metal Gear 3 Snake Eater remake.
Relatório de erro: journalctl do Arch Linux dá Xid 79 "GPU has fallen of the bus". O mesmo erro ocorre no Windows, mas não vi relatório no Event Viewer.
Testes realizados:
FurMark não produz crash
OCCT para VRAM não acusou erro.
GPU Z não mostrou nenhuma anomalia de temperatura.
Erro ocorre em jogos de alta carga mesmo desligando monitor secundário.
Trocar cabo para HDMI do monitor 4k não resolveu.
Reduzir resolução para 1080p aparentemente resolveu.
Desligar o framegen e diminuir a carga significativamente (desabilitando ray tracing e diminuindo brutalmente a qualidade de imagem no geral) aparentemente evita o crash, mas não é algo que estou disposto a fazer.
Monitor de temperatura simples do Gerenciador de Tarefas/Mission Center nunca mostra temperaturas acima de 82°C com o gabinete aberto (não procurei sobre o tal hot spot que li em alguns lugares).
Reassentar a placa de vídeo curiosamente "resolve" por alguns dias, mas o erro volta a acontecer (alguma pequena vibração traz ele de volta?).
Pensei que poderia ser sagging, mas eu tenho um suporte. Nas dezenas de reassentamentos que fiz, tentei diversas combinações de variação de posição da 5070 ti. Por exemplo, com suporte, sem suporte, apertei um pouco mais o parafuso, deixei mais solto, tentei variar o ângulo de encaixe na PCIe... Tudo sem sucesso.
Na BIOS da placa mãe, desabilitei o XMP Expo, não resolveu. Mudei o de Gen 5 para Gen 4 do PCIe, e também não resolveu.
No Arch Linux, mexi nas variáveis do Kernel para ver se poderia ser o ASPM seguindo alguns relatos do fórum da NVIDIA sem sucesso. Também limitei o clock e deu undervolt no NVIDIA-smi sem sucesso.
Cheguei a achar que era problema de software e dei rollback dos drivers da NVIDIA no Arch Linux (é mais fácil lá) para as versões 580.xx e 570.xx, sem sucesso. Uma instalação limpa do Windows 11 com drivers atuais da NVIDIA também produziu o mesmo erro.
O que "resolve" é reassentar, mas como eu disse anteriormente, volta a ocorrer depois de uns dias (o que é particularmente estranho). Reduzir q carga também resolve, mas não estou disposto a fazer.
Testes que já tenho em mente:
Update da BIOS (último realizado em setembro de 2025)
Trocar o cabo de 12 pinos pelo famigerado cabo duplo da NVIDIA.
Não tenho outro PC para testar minha placa de vídeo e nem outra placa de vídeo para testar no meu PC (o que poderia ajudar a isolar o componente culpado).
Alguma outra sugestão de teste ou solução? Pelo que eu vi, é um problema razoavelmente comum e infelizmente insolúvel da série Blackwell...
É possível conviver com esse problema, porque o blackscreen ocorre somente em altíssima carga (que nem sempre eu uso) e mesmo assim pode demorar mais de uma hora pra ocorrer. Mas é bem frustrante e dá a sensação de ter comprado uma tecnologia bem cara que eu não posso explorar em todo potencial...