Symptome und Geltungsbereich
- Ein Spiel zeichnet keine neuen Bilder, während Ton oder SSH weiterlaufen können.
- Der Kernel meldet eine Ring-Zeitüberschreitung und versucht die GPU wiederherzustellen.
Betroffene Umgebung
AMD-GPUs mit dem Kernel-Treiber amdgpu bei OpenGL, Vulkan oder Compute. Ein Schwarzbild ohne erhaltenes Protokoll muss gesondert untersucht werden.
Erkennbare Meldungen (synthetische Beispiele)
amdgpu 0000:03:00.0: ring gfx_0.0.0 timeout, signaled seq=42, emitted seq=43Ersten Fehler und Ergebnis der Wiederherstellung untersuchen; weder Warteschlangenname noch diese Zeile nennen die Ursache.
amdgpu 0000:03:00.0: GPU Recovery Failed: -110Wenn möglich Belege über eine andere Konsole sichern; ein Anwendungsneustart kann unzureichend sein und ein kontrollierter Neustart nötig werden.
Mögliche Ursachen
Das sind mögliche Erklärungen, keine bestätigte Diagnose. Mehrere unabhängige Fehler können gleichzeitig vorliegen.
- Ein Fehler in Anwendung, Mesa oder Kernel kann dazu führen, dass Aufträge nicht mehr abgeschlossen werden.
- Firmware, instabile Taktraten, Stromversorgung oder PCIe-Fehler können ähnlich aussehen; die Zeitüberschreitung unterscheidet sie nicht.
Sicher prüfen
Führe jeweils einen Befehl in der passenden Sitzung aus. Lies zuerst die Erklärung. Großgeschriebene Platzhalter brauchen deine Werte; Werkzeuge und Rechte unterscheiden sich je nach Distribution. Die Website zeigt Befehle an und führt sie niemals aus.
Prüfschritt 1
Kernel-Ereignisse dieses Starts lesen; der Journalzugriff kann Administratorrechte erfordern. Nach einem Neustart -b -1 verwenden, falls dieser Start gespeichert wurde.
journalctl -b -k --no-pager --grep='amdgpu|AER|PCIe Bus Error'Ergebnis einordnen: Der erste Ring-Fehler und vorhergehende PCIe-Ereignisse sind aussagekräftiger als der letzte Reset. Ein erfolgreicher Reset belegt keine behobene Ursache.
Prüfschritt 2
PCI-Geräte und aktive Treiber ohne Änderung der Bindung anzeigen; den AMD-Grafikcontroller suchen.
lspci -nnkErgebnis einordnen: Kernel driver in use sollte bei einem unterstützten Gerät amdgpu nennen. PCI-Adresse für den Bericht festhalten; installierte Module belegen noch keine aktive Bindung.
Nächste Schritte nach Befund
Mit einem vorhandenen Kernel vergleichen
Trat der Fehler nach einem Update auf, einen bereits installierten älteren unterstützten Kernel starten und nur den kürzesten verlässlichen Auslöser prüfen. Arbeitslast und Mesa-Version dabei gleich lassen.
Vorsicht: Vor dem Test Arbeit speichern, beide Starteinträge behalten und wiederholte harte Abstürze vermeiden. Ein stabiler Lauf ist ein schwacher Hinweis.
Wiederherstellung / Rücknahme: Beim nächsten Start den ursprünglichen Kernel wählen und einen eventuell vorübergehend geänderten Standard zurücksetzen.
Hat dir dieser Hinweis geholfen?
GPU-Tuning auf Standard zurückstellen
Wurden Übertaktung, Undervolting oder eigene Treiberparameter gesetzt, die dokumentierten Standardwerte einzeln wiederherstellen. Scheitert ein Minimalbeispiel weiter, vollständige Meldungen vor dem Reset und Versionen melden.
Vorsicht: Zeitlimits nicht lediglich zum Verbergen des Fehlers verlängern und Wiederherstellung nicht auf dem Arbeitsrechner abschalten. Spannung nur nach dokumentierter gerätespezifischer Anleitung ändern.
Wiederherstellung / Rücknahme: Nur eine zuvor dokumentierte notwendige und nachweislich stabile Einstellung wieder setzen; einen Starteintrag ohne experimentelle Parameter behalten.
Hat dir dieser Hinweis geholfen?
Quellen und Prüfung
Diese Anleitung basiert auf Originalquellen von Projekten oder Distributionen und wurde am genannten Datum redaktionell geprüft. Das ist eine Quellenprüfung, kein Nachweis einer auf deiner Hardware reproduzierten Lösung. Log-Beispiele sind synthetische Testdaten. Versionsabhängige Details müssen zur installierten Ausgabe passen.
- AMDGPU module parameters: scheduler timeout and recovery (Projekt- oder Distributionsdokumentation)
- AMDGPU scheduler timeout implementation (Upstream-Implementierung; Verhalten ist versionsabhängig)