Kernel Panic - not syncing: Fatal machine check on current CPU
Hallo Leute, ich habe in letzter Zeit mehrfach täglich ein Kernel Panic, das ganze auf einem 64-Bit-AMD-Rechner mit 3 S-ATA-Platten. Ich habe bereits Memtest für ein paar Stunden durchlaufen lassen, vielleicht kann jemand aus den Screenshots der Meldungen etwas herauslesen? 1- http://picpaste.com/IMG_8468-U3u74oQM.JPG 2- http://picpaste.com/IMG_8469-zOBR4XPX.JPG 3- http://picpaste.com/IMG_8474-iArKU1zu.JPG 4- http://picpaste.com/IMG_8479-UwvARr6W.JPG 5- http://picpaste.com/IMG_8480-bxlLCTx2.JPG (abfotografiert und invertiert). Die Meldungen mit den wenigen Zeilen (1-3) treten direkt während des Bootvorgangs auf, das passiert v.a. beim Kaltstart. Die ausführlicheren Meldungen (4-5) unter einem 3.6er Kernel treten bisher ausschließlich (dann aber oft) auf, wenn ich von einer externen Festplatte Daten auf meine neue interne (2TB/ext3) schaufeln wollte. Danke, viele Grüße Ralf
Am 04.02.2013 20:55, schrieb Ralf Gesellensetter:
Hallo Leute,
ich habe in letzter Zeit mehrfach täglich ein Kernel Panic, das ganze auf einem 64-Bit-AMD-Rechner mit 3 S-ATA-Platten.
Ich habe bereits Memtest für ein paar Stunden durchlaufen lassen, vielleicht kann jemand aus den Screenshots der Meldungen etwas herauslesen?
1- http://picpaste.com/IMG_8468-U3u74oQM.JPG 2- http://picpaste.com/IMG_8469-zOBR4XPX.JPG 3- http://picpaste.com/IMG_8474-iArKU1zu.JPG
4- http://picpaste.com/IMG_8479-UwvARr6W.JPG 5- http://picpaste.com/IMG_8480-bxlLCTx2.JPG
(abfotografiert und invertiert).
Die Meldungen mit den wenigen Zeilen (1-3) treten direkt während des Bootvorgangs auf, das passiert v.a. beim Kaltstart.
Die ausführlicheren Meldungen (4-5) unter einem 3.6er Kernel treten bisher ausschließlich (dann aber oft) auf, wenn ich von einer externen Festplatte Daten auf meine neue interne (2TB/ext3) schaufeln wollte.
Hi, MCE sagt ja auch gerne, dass es sich hier *NICHT* um einen Software Fehler handelt. Nach meiner Erfahrung war das bisher auch immer der Fall. Gerade bei solchen Problemen können auch erst intensivere Rechenoperationen oder Belastungen einen Hardware Fehler auslösen, den Tests wie memcheck nicht auslösen. Beispiel: Ein Kunde hatte zwei HP ML Server erneuert und wollte einen HA Webserver daraus haben. Installiert, konfiguriert, und (Kunde kam nicht so nach) ein halbes Jahr lang getestet, ohne Probleme. Dann gingen die Kisten live und zack die selben Probleme wie du hattest: die CPU war defekt (ich hatte aber auch erst die ganze Zeit auf SW getippt). Am besten mit Austauschkomponenten für den RAM, Motherboard und CPU einmal experimentieren. -- /* Mit freundlichem Gruß / With kind regards, Patrick Matthäi GNU/Linux Debian Developer E-Mail: pmatthaei@debian.org patrick@linux-dev.org */
On Mon, 2013-02-04 21:19:07 +0100, Patrick Matthäi <pmatthaei@debian.org> wrote:
Am 04.02.2013 20:55, schrieb Ralf Gesellensetter:
Ich habe bereits Memtest für ein paar Stunden durchlaufen lassen, vielleicht kann jemand aus den Screenshots der Meldungen etwas herauslesen? [...] Am besten mit Austauschkomponenten für den RAM, Motherboard und CPU einmal experimentieren.
Ich würde bei der CPU anfangen. Und mit dem Netzteil weitermachen. MfG, JBG -- Jan-Benedict Glaw jbglaw@lug-owl.de +49-172-7608481 Signature of: Warum ist Scheiße braun? ...weil braun schon immer scheiße ist! the second :
Jan-Benedict Glaw schrieb:
On Mon, 2013-02-04 21:19:07 +0100, Patrick Matthäi <pmatthaei@debian.org> wrote:
Am 04.02.2013 20:55, schrieb Ralf Gesellensetter:
Ich habe bereits Memtest für ein paar Stunden durchlaufen lassen, vielleicht kann jemand aus den Screenshots der Meldungen etwas herauslesen? [...] Am besten mit Austauschkomponenten für den RAM, Motherboard und CPU einmal experimentieren.
Ich würde bei der CPU anfangen. Und mit dem Netzteil weitermachen.
Danach mal einen Blick auf die Kondensatoren auf dem Mainboard werfen, naja, es einfach mal wechseln. (Machine Check Exceptions heissen eben die HW fühlt sich unwohl.)
MfG, JBG
Gruss Jan --
Hallo Jan-Benedict, danke auch für diesen Tipp...: Am Dienstag, 5. Februar 2013 schrieb Jan-Benedict Glaw:
Ich würde bei der CPU anfangen. Und mit dem Netzteil weitermachen.
CPU läuft jetzt wieder mit 2 Kernen (und Panics nur manchmal beim Kaltstart), allerdings tauchen nun häufige Startschwierigkeiten * auf, die nach meiner Recherche vom Netzteil her rühren können (z.B. Kaltlötstelle darin). Ich betreibe an meinem Netzteil immerhin 2-3 S-ATA-Platten und über USB neben Maus (Tastatur ist PS2) einen Laserdrucker, einen alten Scanner und einen Wifi-Dongle. Das NT ist ein HEC 350TE-2WX (103/276/350 Watt). Kann die CPU-induzierte Kernel-Panic auch vom Netzteil kommen? Danke Ralf *) NT läuft ohne Piep und Bild (aber WLAN-Dongle leuchtet) Manchmal startet der PC dann, wenn ich alle USB-Kabel abziehe (hier müsste ich einen aktiv-HUB testen). Aber manchmal rührt sich das NT dann wieder gar nicht mehr, erst nach Netzstecker ziehen (mehrmals) startet der PC. Vgl. etwa http://www.computerbase.de/forum/showthread.php?t=396271 BTW hängt der Rechner als Master an einer schaltbaren Steckerleiste...
Am Montag, 25. Februar 2013 schrieb RalfGesellensetter:
CPU läuft jetzt wieder mit 2 Kernen (und Panics nur manchmal beim Kaltstart), allerdings tauchen nun häufige Startschwierigkeiten * auf, die nach meiner Recherche vom Netzteil her rühren können (z.B. Kaltlötstelle darin).
Hallo, um den Thread zu schließen: Mit großer Wahrscheinlichkeit waren Netzteil und CPU hinüber, evtl. auch das MB. Um mich vor Kosten um die 60 Eu + Umbau zu bewahren, habe ich einen aufgemöbelten Gebraucht-PC (Marke: HP) mit kompatibler/gleichwertiger CPU besorgt (ca. 120 Eu) und bin nach Umbau meiner Platte alle Sorgen los. Als Nebeneffekt hätte ich eine 160GB S-ATA-Platte zu vergeben... Danke an alle Supporter, (horse dead? dismount!) Regards Ralf
On Mon, Feb 04, 2013 at 08:55:51PM +0100, Ralf Gesellensetter wrote:
1- http://picpaste.com/IMG_8468-U3u74oQM.JPG 2- http://picpaste.com/IMG_8469-zOBR4XPX.JPG 3- http://picpaste.com/IMG_8474-iArKU1zu.JPG
4- http://picpaste.com/IMG_8479-UwvARr6W.JPG 5- http://picpaste.com/IMG_8480-bxlLCTx2.JPG
(abfotografiert und invertiert).
Die Meldungen mit den wenigen Zeilen (1-3) treten direkt während des Bootvorgangs auf, das passiert v.a. beim Kaltstart.
Ich wuerde mal das machen was da steht - Den MCE dekodieren. Ist aber Hardware so wie ich das sehe - CPU/Ram/Spannungsstabilitaet und/oder Temperatur. Wobei wenn du sagst Kaltstart ist das unwahrscheinlich. Flo -- Florian Lohoff f@zz.de
Hallo Flo & all, danke für die hilfreichen Rückmeldungen. Am Dienstag, 5. Februar 2013 schrieben Sie:
Ich wuerde mal das machen was da steht - Den MCE dekodieren.
Ich denke mal, du meinst: apt-get install mcelog und dann? "Run the above through 'mcelog --ascii'" was genau soll ich tun? Ich versuch mal: mcelog --ascii mce: [Hardware Error]: TSC 11f60d579e ADDR cf800000 mce: [Hardware Error]: TSC 11f60d579e ADDR cf800000 TSC 11f60d579e ADDR cf800000 TSC 11f60d579e ADDR cf800000 CPU 0: Machine Check Exception: 4 Bank 1:b600000000000000000000101 Hardware event. This is not a software error. CPU 0 BANK 1 TSC 11f60d579e ADDR cf800000 STATUS b600000000000000 MCGSTATUS 4 CPU 0: Machine Check Exception: 4 Bank 1:b600000000000000000000101 Processor 2:60fv2 time 1359970252 socket 0 apic 0 microcode 83 Processor 2:60fv2 time 1359970252 socket 0 apic 0 microcode 83 Modulo einiger Tippfehler kommt als Zusatzinfo nur als Bestätigung: "Hardware event. This is not a software error." Müsste die Screenshots mal durch eine ocr-chain jagen. Ob es hilft, die Kiste einfach mal wieder zu zu schrauben und ggf. eine der alten Platten abzustöpseln? Ich halte euch auf dem laufenden... VG Ralf
Am 04.02.2013 20:55, schrieb Ralf Gesellensetter:
Hallo Leute,
3- http://picpaste.com/IMG_8474-iArKU1zu.JPG Ich tippe auf einen L1 Cache Error der CPU0.
Kann einfach nur ein Problem mit der Spannungsversorgung der CPU sein, aber auch die CPU selber. Du könntest den L1 Cache abschalten, aber empfehlenswert ist das nicht da dabei viel Performance verloren geht. Da ging mal beim booten per Kerneloption. Ggf. findet der Memchecker kein Problem, weil ggf. die CPU- Caches abschaltet. Ich bin mir da aber unsicher. Ggf. hilft es noch einzelnde CPU-Kerne/CPU abzuschalten usw. um das Problem einzugrenzen. MfG... Pierre
Hallo Pierre, und danke für deine Einschätzung, ist vermutlich dicht dran: Am Donnerstag, 7. Februar 2013 schrieb Pierre Bernhardt:
Ggf. hilft es noch einzelnde CPU-Kerne/CPU abzuschalten usw. um das Problem einzugrenzen.
Möglicherweise habe ich dies unwissentlich im BIOS getan (ich gebe zu, dass ich längst nicht jede Option verstehe), oder der Kernel tut dies automatisch? Jedenfalls läuft der Rechner in den letzten Tagen stabil aber langsam mit nur 1 Kern. Zum Vergleich habe ich mal eine alte und eine neue Ausgabe von # zcat syslog.2.gz |grep -i cpu # A bzw. # zcat syslog.7.gz |grep -i cpu # B hochgeladen: A: http://paste.debian.net/233414/ B: http://paste.debian.net/233415/ Wichtige Unterschiede: ... x86 PAT enabled: cpu 0, old 0x7040600070406, new 0x7010600070106
Vorher
smpboot: Allowing 4 CPUs, 2 hotplug CPUs ... smpboot: CPU0: AMD Athlon(tm) Dual Core Processor 5050e stepping 02 Brought up 2 CPUs ... powernow-k8: Found 1 AMD Athlon(tm) Dual Core Processor 5050e (2 cpu cores) (version 2.20.00)
Nachher smpboot: Allowing 1 CPUs, 0 hotplug CPUs ... smpboot: weird, boot CPU (#0) not listed by the BIOS Brought up 1 CPUs ... powernow-k8: Found 1 AMD Athlon(tm) Dual Core Processor 5050e (1 cpu cores) (version 2.20.00)
VG Ralf
Teilnehmer (8)
-
Florian Lohoff
-
Jan Seiffert
-
Jan-Benedict Glaw
-
Patrick Matthäi
-
Pierre Bernhardt
-
Ralf Gesellensetter
-
Ralf Gesellensetter
-
RalfGesellensetter