{"id":135,"date":"2026-08-14T07:46:58","date_gmt":"2026-08-14T07:46:58","guid":{"rendered":"https:\/\/linuxfokus.de\/?p=135"},"modified":"2026-08-14T07:46:58","modified_gmt":"2026-08-14T07:46:58","slug":"laufwerksueberwachung-auf-fedora-mit-performance-co-pilot-smart-nvme-logs-grafana-und-alerts","status":"publish","type":"post","link":"https:\/\/linuxfokus.de\/laufwerksueberwachung-auf-fedora-mit-performance-co-pilot-smart-nvme-logs-grafana-und-alerts\/","title":{"rendered":"Laufwerks\u00fcberwachung auf Fedora mit Performance Co\u2011Pilot: SMART, NVMe\u2011Logs, Grafana und Alerts"},"content":{"rendered":"<p><strong>Lead:<\/strong> Festplatten und SSDs geben oft lange vor dem Ausfall Warnsignale \u2014 Temperaturanstiege, steigende Fehlerz\u00e4hler und Verschlei\u00dfindikatoren. Performance Co\u2011Pilot (PCP) erfasst SMART\u2011Daten kontinuierlich, decodiert NVMe\u2011Fehlerlogs, benutzt WWID f\u00fcr verl\u00e4ssliches Ger\u00e4tetracking und integriert sich in Grafana. Dieser Beitrag erkl\u00e4rt, wie Sie PCP auf Fedora einrichten, welche Metriken wirklich z\u00e4hlen und wie Sie mit pmie einfache Alarme realisieren.<\/p>\n<h2>Warum kontinuierliches Monitoring statt Einzelpr\u00fcfung?<\/h2>\n<p>Tools wie smartctl liefern eine Momentaufnahme. PCP geht weiter: Die SMART\u2011PMDA sammelt Werte fortlaufend und schreibt Zeitreihen. So lassen sich Trends erkennen \u2014 etwa ein allm\u00e4hlich steigender Reallocated\u2011Sector\u2011Count oder eine sukzessive Zunahme der NVMe\u2011Verschlei\u00dfanzeige. Solche Entwicklungen weisen oft fr\u00fcher auf Probleme hin als ein einmaliger Check.<\/p>\n<h2>Vorbereitungen und Voraussetzungen<\/h2>\n<p>Der beschriebene Workflow wurde f\u00fcr Fedora empfohlen (Fedora 39 oder neuer). Sie ben\u00f6tigen root- oder sudo\u2011Rechte und die smartmontools, da das PCP\u2011SMART\u2011PMDA smartctl zur Abfrage benutzt.<\/p>\n<pre><code>$ sudo dnf install smartmontools<\/code><\/pre>\n<p>Installieren Sie anschlie\u00dfend PCP und das SMART\u2011PMDA:<\/p>\n<pre><code>$ sudo dnf install pcp pcp-pmda-smart<\/code><\/pre>\n<p>Das PMDA installiert sich typischerweise \u00fcber das mitgelieferte Installer\u2011Skript im PMDA\u2011Verzeichnis, zum Beispiel \/var\/lib\/pcp\/pmdas\/smart\/ mit <code>.\/Install<\/code>. Starten bzw. aktivieren Sie den Collector\u2011Daemon:<\/p>\n<pre><code>$ sudo systemctl start pmcd\n$ sudo systemctl enable pmcd<\/code><\/pre>\n<h2>Wichtige SMART\u2011Metriken und ihre Bedeutung<\/h2>\n<p>PCP legt SMART\u2011Attribute in Namespaces wie <code>smart.attributes.*<\/code> f\u00fcr klassische ATA\/SATA und <code>smart.nvme_attributes.*<\/code> f\u00fcr NVMe\u2011Laufwerke ab. Einige Kennzahlen, auf die Sie achten sollten:<\/p>\n<h3>Temperatur<\/h3>\n<p>Temperatur ist ein einfacher Indikator f\u00fcr K\u00fchlungsprobleme. PCP stellt Werte z. B. unter <code>smart.attributes.temperature_celsius.value<\/code> und <code>smart.nvme_attributes.temperature_sensor_one<\/code> bereit. Als grobe Orientierung gelten dauerhaft \u00fcber 60 \u00b0C f\u00fcr HDDs oder \u00fcber 70 \u00b0C f\u00fcr SSDs\/NVMe als kritisch.<\/p>\n<h3>Power\u2011On Hours und Power\u2011Cycles<\/h3>\n<p>Die Gesamtbetriebszeit (<code>power_on_hours<\/code>) und Anzahl der Ein\/Aus\u2011Zyklen geben Hinweise auf das Alter und Beanspruchung des Laufwerks. Hohe Werte sind kein Fehler an sich, helfen aber beim Lebensdauer\u2011Abgleich.<\/p>\n<h3>Verschlei\u00df (NVMe)<\/h3>\n<p>F\u00fcr NVMe\u2011Ger\u00e4te ist <code>smart.nvme_attributes.percentage_used<\/code> die zentrale Gr\u00f6\u00dfe: 0\u2013100 % zeigt den verbrauchten Anteil der spezifizierten Lebensdauer. Ab etwa 80 % ist erh\u00f6hte Aufmerksamkeit angebracht, ab 90 % empfiehlt sich ein Austausch\u2011Plan.<\/p>\n<h3>Reallocated \/ Pending Sectors<\/h3>\n<p><code>smart.attributes.reallocated_sector_count.value<\/code> und <code>smart.attributes.current_pending_sector.value<\/code> zeigen fehlerhafte Bl\u00f6cke beziehungsweise wartende Remap\u2011Vorg\u00e4nge. Jede Zunahme bei Reallocated Sectors ist ein Alarmsignal.<\/p>\n<h2>WWID\u2011basiertes Tracking: Stabilit\u00e4t trotz Ger\u00e4tezuordnung<\/h2>\n<p>Eine Herausforderung im Monitoring sind wechselnde Device\u2011Namen (z. B. \/dev\/nvme0n1 \u2192 \/dev\/nvme1n1). PCP stellt WWID\u2011basierte Metriken bereit (<code>smart.wwid.*<\/code>), sodass Historie und Alarmierung am tats\u00e4chlichen Laufwerk ankn\u00fcpfen, unabh\u00e4ngig von tempor\u00e4ren Systempfaden.<\/p>\n<h2>NVMe\u2011Fehlerprotokolle analysieren<\/h2>\n<p>NVMe\u2011Laufwerke f\u00fchren einen Fehlerlog (Log Page 0x01). Das SMART\u2011PMDA kann diesen Log auslesen und in menschenlesbare Eintr\u00e4ge \u00fcbersetzen, etwa mit Informationen zu Fehlerarten, Statuscodes, betroffenen LBAs, Namespace und Timestamp. Entscheidend ist <code>smart.nvme_error_log.error_count<\/code> \u2014 sollte idealerweise null sein. Erg\u00e4nzende Felder wie <code>smart.nvme_error_log.status_code<\/code> erleichtern die Diagnose.<\/p>\n<h2>Seagate\u2011FARM: Hersteller\u2011spezifische Telemetrie<\/h2>\n<p>F\u00fcr Seagate\u2011Laufwerke bietet PCP zus\u00e4tzlich das FARM\u2011PMDA (Field Accessible Reliability Metrics). FARM liefert detailliertere Metriken, etwa kopfspezifische Fehlerstatistiken, l\u00e4ngere Temperatur\u2011Historien, feinere Power\u2011Metriken und Leistungskennzahlen. FARM ist herstellerspezifisch und funktioniert nur f\u00fcr Seagate\u2011SATA\/SAS\u2011Modelle.<\/p>\n<pre><code>$ sudo dnf install pcp-pmda-farm\n$ cd \/var\/lib\/pcp\/pmdas\/farm\/ &amp;&amp; sudo .\/Install<\/code><\/pre>\n<h2>Visualisierung mit Grafana<\/h2>\n<p>PCP integriert sich \u00fcber das grafana\u2011pcp Plugin. Installieren Sie Grafana und das Plugin\u2011Paket:<\/p>\n<pre><code>$ sudo dnf install grafana grafana-pcp<\/code><\/pre>\n<p>Starten Sie Grafana und den PCP\u2011Proxy:<\/p>\n<pre><code>$ sudo systemctl start grafana-server pmproxy\n$ sudo systemctl enable grafana-server pmproxy<\/code><\/pre>\n<p>Greifen Sie auf http:\/\/localhost:3000 zu (Standard: admin\/admin) und legen Sie als Datasource die PCP Vector\u2011Verbindung an. Typische Panels f\u00fcr ein Laufwerks\u2011Dashboard:<\/p>\n<ul>\n<li>Timeseries: Temperaturverl\u00e4ufe mehrerer Laufwerke mit Schwellen f\u00fcr Warnungen.<\/li>\n<li>Gauge: NVMe\u2011Verschlei\u00df (% used) mit 80\/90\u2011Schwellen.<\/li>\n<li>Stat: Health\u2011Status (PASSED\/FAILED) aggregiert pro Laufwerk.<\/li>\n<\/ul>\n<p>Einmal konfigurierte Dashboards zeigen Trends \u00fcber Wochen und Monate und sind n\u00fctzlich, um Auff\u00e4lligkeiten zeitlich einzugrenzen.<\/p>\n<h2>Automatische Alarme mit pmie<\/h2>\n<p>pmie (Performance Metrics Inference Engine) wertet Metrikausdr\u00fccke regelbasiert aus und f\u00fchrt Aktionen aus. So lassen sich Syslog\u2011Eintr\u00e4ge, Shell\u2011Befehle oder andere Aktionen ausl\u00f6sen, wenn Bedingungen eintreten.<\/p>\n<p>Beispiel: Eine Regel, die NVMe\u2011Temperaturen \u00fcber 70 \u00b0C protokolliert, k\u00f6nnte folgenderma\u00dfen formuliert werden (kompakter Stil):<\/p>\n<pre><code>\/\/ Beispieleintrag f\u00fcr \/etc\/pcp\/pmie\/smart-health.pmie\nsome_inst(smart.nvme_attributes.temperature_sensor_one &gt; 70)\n  -&gt; syslog 10 min \"NVMe temperature critical:\" \" %i at %v \u00b0C\";<\/code><\/pre>\n<p>Weitere Regeln pr\u00fcfen etwa Verschlei\u00df (&gt;80 %), Reallocated\u2011Sektoren (&gt;0) oder NVMe\u2011Fehlerz\u00e4hler. Testen Sie Regeln mit:<\/p>\n<pre><code>$ sudo pmie -v -c \/etc\/pcp\/pmie\/smart-health.pmie -t 10second<\/code><\/pre>\n<p>Wenn alles passt, l\u00e4sst sich pmie als Service dauerhaft aktivieren.<\/p>\n<h2>Dauerhafte Datenspeicherung mit pmlogger<\/h2>\n<p>pmlogger schreibt die gesammelten Metriken in historische Zeitreihen. Aktivieren Sie pmlogger und stellen Sie sicher, dass SMART\u2011Gruppen in der Konfiguration eingeschlossen sind:<\/p>\n<pre><code>$ sudo systemctl start pmlogger\n$ sudo systemctl enable pmlogger\n$ sudo pmlogconf -r \/var\/lib\/pcp\/config\/pmlogger\/config.default<\/code><\/pre>\n<p>Historische Logs erlauben die Nachverfolgung, wann eine Verschlechterung begann \u2014 oft die wichtigste Hilfe bei Ursachenforschung.<\/p>\n<h2>Fazit<\/h2>\n<p>PCP erg\u00e4nzt klassische SMART\u2011Pr\u00fcfungen um kontinuierliche Erfassung, aussagekr\u00e4ftige NVMe\u2011Fehlerprotokolle, WWID\u2011basiertes Tracking und optionale Seagate\u2011FARM\u2011Metriken. Kombiniert mit Grafana\u2011Dashboards, pmlogger\u2011Archivierung und pmie\u2011Alarmen erhalten Sie ein praxisf\u00e4higes System, das fr\u00fche Warnzeichen erkennt und Ihnen Zeit zum Reagieren gibt. Ein paar Minuten Setup sparen unter Umst\u00e4nden Stunden an Datenrettung oder Ausfallzeiten.<\/p>\n<aside class=\"lfem-source-box\"><strong>Quelle:<\/strong> <a href=\"https:\/\/fedoramagazine.org\/monitor-your-drive-health-with-performance-co-pilot-on-fedora\/\" target=\"_blank\" rel=\"noopener noreferrer external\">Fedora Magazine<\/a><br \/><small>LinuxFokus hat den verlinkten Originalartikel als Recherchegrundlage ausgewertet und daraus einen eigenst\u00e4ndigen deutschsprachigen Beitrag erstellt. F\u00fcr vollst\u00e4ndige Prim\u00e4rdetails gilt die Originalquelle.<\/small><\/aside>\n","protected":false},"excerpt":{"rendered":"<p>Performance Co\u2011Pilot (PCP) erweitert SMART\u2011\u00dcberwachung auf Fedora um historische Metriken, NVMe\u2011Fehlerprotokolle, WWID\u2011Tracking und Seagate\u2011FARM\u2011Telemetrie. In diesem Praxisartikel zeigen wir Installation, wichtige Kennzahlen, Grafana\u2011Visualisierung und Basis\u2011Alarmregeln.<\/p>\n","protected":false},"author":1,"featured_media":136,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"ocean_front_end_style_editor":"no","ocean_post_layout":"","ocean_both_sidebars_style":"","ocean_both_sidebars_content_width":0,"ocean_both_sidebars_sidebars_width":0,"ocean_sidebar":"","ocean_second_sidebar":"","ocean_disable_margins":"enable","ocean_add_body_class":"","ocean_shortcode_before_top_bar":"","ocean_shortcode_after_top_bar":"","ocean_shortcode_before_header":"","ocean_shortcode_after_header":"","ocean_has_shortcode":"","ocean_shortcode_after_title":"","ocean_shortcode_before_footer_widgets":"","ocean_shortcode_after_footer_widgets":"","ocean_shortcode_before_footer_bottom":"","ocean_shortcode_after_footer_bottom":"","ocean_display_top_bar":"default","ocean_display_header":"default","ocean_header_style":"","ocean_center_header_left_menu":"","ocean_custom_header_template":"","ocean_custom_logo":0,"ocean_custom_retina_logo":0,"ocean_custom_logo_max_width":0,"ocean_custom_logo_tablet_max_width":0,"ocean_custom_logo_mobile_max_width":0,"ocean_custom_logo_max_height":0,"ocean_custom_logo_tablet_max_height":0,"ocean_custom_logo_mobile_max_height":0,"ocean_header_custom_menu":"","ocean_menu_typo_font_family":"","ocean_menu_typo_font_subset":"","ocean_menu_typo_font_size":0,"ocean_menu_typo_font_size_tablet":0,"ocean_menu_typo_font_size_mobile":0,"ocean_menu_typo_font_size_unit":"px","ocean_menu_typo_font_weight":"","ocean_menu_typo_font_weight_tablet":"","ocean_menu_typo_font_weight_mobile":"","ocean_menu_typo_transform":"","ocean_menu_typo_transform_tablet":"","ocean_menu_typo_transform_mobile":"","ocean_menu_typo_line_height":0,"ocean_menu_typo_line_height_tablet":0,"ocean_menu_typo_line_height_mobile":0,"ocean_menu_typo_line_height_unit":"","ocean_menu_typo_spacing":0,"ocean_menu_typo_spacing_tablet":0,"ocean_menu_typo_spacing_mobile":0,"ocean_menu_typo_spacing_unit":"","ocean_menu_link_color":"","ocean_menu_link_color_hover":"","ocean_menu_link_color_active":"","ocean_menu_link_background":"","ocean_menu_link_hover_background":"","ocean_menu_link_active_background":"","ocean_menu_social_links_bg":"","ocean_menu_social_hover_links_bg":"","ocean_menu_social_links_color":"","ocean_menu_social_hover_links_color":"","ocean_disable_title":"default","ocean_disable_heading":"default","ocean_post_title":"","ocean_post_subheading":"","ocean_post_title_style":"","ocean_post_title_background_color":"","ocean_post_title_background":0,"ocean_post_title_bg_image_position":"","ocean_post_title_bg_image_attachment":"","ocean_post_title_bg_image_repeat":"","ocean_post_title_bg_image_size":"","ocean_post_title_height":0,"ocean_post_title_bg_overlay":0.5,"ocean_post_title_bg_overlay_color":"","ocean_disable_breadcrumbs":"default","ocean_breadcrumbs_color":"","ocean_breadcrumbs_separator_color":"","ocean_breadcrumbs_links_color":"","ocean_breadcrumbs_links_hover_color":"","ocean_display_footer_widgets":"default","ocean_display_footer_bottom":"default","ocean_custom_footer_template":"","ocean_post_oembed":"","ocean_post_self_hosted_media":"","ocean_post_video_embed":"","ocean_link_format":"","ocean_link_format_target":"self","ocean_quote_format":"","ocean_quote_format_link":"post","ocean_gallery_link_images":"on","ocean_gallery_id":[],"footnotes":""},"categories":[2],"tags":[14,18,19,17,15,20,21,16],"class_list":["post-135","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-linux-news","tag-fedora","tag-grafana","tag-monitoring","tag-nvme","tag-performance-co-pilot","tag-pmie","tag-pmlogger","tag-smart","entry","has-media"],"_links":{"self":[{"href":"https:\/\/linuxfokus.de\/wp-json\/wp\/v2\/posts\/135","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/linuxfokus.de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/linuxfokus.de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/linuxfokus.de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/linuxfokus.de\/wp-json\/wp\/v2\/comments?post=135"}],"version-history":[{"count":0,"href":"https:\/\/linuxfokus.de\/wp-json\/wp\/v2\/posts\/135\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/linuxfokus.de\/wp-json\/wp\/v2\/media\/136"}],"wp:attachment":[{"href":"https:\/\/linuxfokus.de\/wp-json\/wp\/v2\/media?parent=135"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/linuxfokus.de\/wp-json\/wp\/v2\/categories?post=135"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/linuxfokus.de\/wp-json\/wp\/v2\/tags?post=135"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}