Symptome und Geltungsbereich
- Der Kernel meldet wiederholt PCIe Bus Error.
- Ein Endgerät kann sich zurücksetzen oder verschwinden; korrigierte Fehler können ohne sichtbare Unterbrechung auftreten.
Betroffene Umgebung
PCI-Express-Systeme, deren Firmware Linux AER-Kontrolle erlaubt; Geräte, Brücken und Root-Ports können alle in Meldungen erscheinen.
Erkennbare Meldungen (synthetische Beispiele)
pcieport 0000:00:03.1: PCIe Bus Error: severity=Corrected, type=Physical Layer, (Receiver ID)Rate und Symptome beobachten; korrigiert heißt nicht dauerhaft unbedenklich und eine Meldung identifiziert kein fehlerhaftes Bauteil.
pcieport 0000:00:03.1: PCIe Bus Error: severity=Uncorrectable (Fatal), type=Transaction Layer, (Requester ID)Fatal gegenüber Non-Fatal und Wiederherstellungsergebnis prüfen; vollständige Anforderer-/Statusfelder vor Reset sichern.
Mögliche Ursachen
Das sind mögliche Erklärungen, keine bestätigte Diagnose. Mehrere unabhängige Fehler können gleichzeitig vorliegen.
- Signalqualität, Riser, Stecker, Geräte-Firmware oder Plattform-Firmware können beitragen.
- Auch Treiber-Transaktionen können Meldungen auslösen; der meldende Root-Port muss nicht das fehlerhafte Bauteil sein.
Sicher prüfen
Führe jeweils einen Befehl in der passenden Sitzung aus. Lies zuerst die Erklärung. Großgeschriebene Platzhalter brauchen deine Werte; Werkzeuge und Rechte unterscheiden sich je nach Distribution. Die Website zeigt Befehle an und führt sie niemals aus.
Prüfschritt 1
AER-Schwere, Quell-IDs und Wiederherstellungsereignisse lesen; Administrator-Journalzugriff kann nötig sein.
journalctl -b -k --no-pager --grep='AER|PCIe Bus Error|DPC:'Ergebnis einordnen: Corrected bedeutet Protokoll-Wiederherstellung dieses Fehlers; Uncorrectable Fatal ist schwerer. Ereignisrate und Gerätesymptome vergleichen, statt alle AER-Meldungen gleich zu behandeln.
Prüfschritt 2
PCI-Brückentopologie unverändert lesen. Bus-Adressen mit detaillierten AER-Daten abgleichen.
lspci -tErgebnis einordnen: Meldenden vorgelagerten Port und seine Endgeräte finden. Eine gemeinsame Brücke kann mehrere betroffene Geräte erklären, ohne jedes als defekt zu belegen.
Nächste Schritte nach Befund
Ermittelten Link-Pfad ausgeschaltet prüfen
Ordnen sich wiederholte Linkfehler einem physischen Pfad zu, normal ausschalten und Sitz, unterstützte Kabel sowie Riser nach Herstelleranleitung prüfen. Wenn möglich direkte unterstützte Verbindung bei gleicher Arbeitslast vergleichen.
Vorsicht: Vor neuem Stecken Netzstrom trennen. Eine niedrigere ausgehandelte Link-Geschwindigkeit allein beweist keine fehlerhafte Verkabelung; Energiesparen und Gerätefähigkeiten zählen ebenfalls.
Wiederherstellung / Rücknahme: Nach Prüfung zur dokumentierten unterstützten Anordnung zurückkehren; bei verdächtigem Zwischengerät stabilen direkten Pfad behalten.
Hat dir dieser Hinweis geholfen?
Gezielte Firmware- oder Kernel-Korrektur anwenden
Begannen Fehler nach einem Update oder passen zu Hersteller-Erratum, im Wartungsfenster relevanten unterstützten Kernel oder Geräte-/Plattform-Firmware-Korrektur vergleichen. Topologie und vollständige Statusfelder dem Hersteller melden.
Vorsicht: pci=noaer nicht als Reparatur verwenden; es versteckt Meldungen. Keine ununterstützten PCIe-Generationen erzwingen und Schutz nicht ohne gerätespezifische Belege überall abschalten.
Wiederherstellung / Rücknahme: Bei schlechterem Zugriff älteren unterstützten Kernel oder dokumentierten Firmware-Rettungsweg des Herstellers nutzen.
Hat dir dieser Hinweis geholfen?
Quellen und Prüfung
Diese Anleitung basiert auf Originalquellen von Projekten oder Distributionen und wurde am genannten Datum redaktionell geprüft. Das ist eine Quellenprüfung, kein Nachweis einer auf deiner Hardware reproduzierten Lösung. Log-Beispiele sind synthetische Testdaten. Versionsabhängige Details müssen zur installierten Ausgabe passen.
- Kernel PCIe AER severity and recovery (Projekt- oder Distributionsdokumentation)
- Kernel PCI error recovery model (Projekt- oder Distributionsdokumentation)