Symptome und Geltungsbereich
- Bildausgabe oder GPU-Arbeit endet und nvidia-smi kann das Gerät nicht nutzen.
- NVRM meldet Xid 79 oder ausdrücklich GPU has fallen off the bus.
Betroffene Umgebung
NVIDIA-GPUs mit NVIDIA-Kernelmodul; Desktop-, Compute- und Passthrough-Systeme können die PCIe-Erreichbarkeit verlieren.
Erkennbare Meldungen (synthetische Beispiele)
NVRM: Xid (PCI:0000:01:00): 79, GPU has fallen off the bus.PCIe-, Stromversorgungs- und Plattform-Belege untersuchen; ein Neustart kann Zugriff wiederherstellen, nennt aber keine Ursache.
Mögliche Ursachen
Das sind mögliche Erklärungen, keine bestätigte Diagnose. Mehrere unabhängige Fehler können gleichzeitig vorliegen.
- Instabiler PCIe-Link, Stromverlust des Geräts oder Wechselwirkungen mit Plattform-Firmware sind möglich.
- Auch Treiber- und Virtualisierungsfehler sind möglich; Xid 79 bezeichnet verlorenen Zugriff statt eines eindeutig defekten Bauteils.
Sicher prüfen
Führe jeweils einen Befehl in der passenden Sitzung aus. Lies zuerst die Erklärung. Großgeschriebene Platzhalter brauchen deine Werte; Werkzeuge und Rechte unterscheiden sich je nach Distribution. Die Website zeigt Befehle an und führt sie niemals aus.
Prüfschritt 1
Kernel-Ereignisse mit gegebenenfalls nötigem Administratorzugriff lesen; den Start mit dem Ausfall untersuchen.
journalctl -b -k --no-pager --grep='NVRM|AER|PCIe Bus Error'Ergebnis einordnen: Vorherige unkorrigierte AER-Fehler stützen die Untersuchung des PCIe-Pfads. Ihr Fehlen beweist wegen möglicherweise unvollständiger Protokolle keinen gesunden Link.
Prüfschritt 2
01:00.0 durch die in lspci gefundene GPU-Adresse ersetzen. PCI-Konfiguration wird gelesen; manche Details benötigen Administratorrechte.
lspci -nnk -vv -s 01:00.0Ergebnis einordnen: Link-Fähigkeiten und aktuellen Status vergleichen. Ein nach dem Ausfall fehlendes Gerät ist aussagekräftiger als ein allein langsam ausgehandelter Link.
Nächste Schritte nach Befund
PCIe-Pfad im ausgeschalteten Zustand prüfen
Deuten Meldungen auf verlorenen PCIe-Zugriff, normal ausschalten und GPU-Sitz, Riser sowie vom Hersteller vorgegebene Stromstecker prüfen. Ein unterstützter Test direkt im Steckplatz kann einen Zwischenpfad eingrenzen.
Vorsicht: Netzstrom trennen und Hardware-Anleitung beachten; eine aktive GPU nie neu stecken und keine modularen Netzteilkabel verschiedener Netzteile mischen.
Wiederherstellung / Rücknahme: Zur dokumentierten ursprünglichen Anordnung erst nach Prüfung zurückkehren; bei verdächtigem Riser den sichereren stabilen Pfad behalten.
Hat dir dieser Hinweis geholfen?
Vor einem weiteren Volltest Belege sammeln
Erklären mechanische Prüfungen den Verlust nicht, BIOS-Version, Treiberversion, Topologie und erste Xid-/AER-Meldungen für NVIDIA oder Systemhersteller festhalten. Jeweils eine unterstützte Treiber- oder Firmware-Änderung im Wartungsfenster vergleichen.
Vorsicht: Keinen GPU-Reset im laufenden Betrieb auf der Anzeige-GPU oder bei aktiver Compute-Arbeit ausführen. Firmware-Updates erfordern die Wiederherstellungsanleitung des Herstellers.
Wiederherstellung / Rücknahme: Vorheriges Treiberpaket und unterstützten Starteintrag behalten; bei Verschlechterung wiederherstellen.
Hat dir dieser Hinweis geholfen?
Quellen und Prüfung
Diese Anleitung basiert auf Originalquellen von Projekten oder Distributionen und wurde am genannten Datum redaktionell geprüft. Das ist eine Quellenprüfung, kein Nachweis einer auf deiner Hardware reproduzierten Lösung. Log-Beispiele sind synthetische Testdaten. Versionsabhängige Details müssen zur installierten Ausgabe passen.
- NVIDIA Xid catalog: Xid 79 (Projekt- oder Distributionsdokumentation)
- NVIDIA: working with Xid errors (Projekt- oder Distributionsdokumentation)