{"id":424590,"date":"2026-06-11T13:34:09","date_gmt":"2026-06-11T13:34:09","guid":{"rendered":"https:\/\/pandorafms.com\/?p=424590"},"modified":"2026-06-11T13:34:15","modified_gmt":"2026-06-11T13:34:15","slug":"gpu-monitoring","status":"publish","type":"post","link":"https:\/\/pandorafms.com\/fr\/it-topics\/gpu-monitoring\/","title":{"rendered":"GPU monitoring : monitoring des GPU pour l\u2019IA et les environnements hybrides"},"content":{"rendered":"<p>[et_pb_section fb_built=\u00a0\u00bb1&Prime; admin_label=\u00a0\u00bbSection\u00a0\u00bb _builder_version=\u00a0\u00bb4.22.0&Prime; _module_preset=\u00a0\u00bbdefault\u00a0\u00bb custom_margin=\u00a0\u00bb0px||0px||false|false\u00a0\u00bb custom_padding=\u00a0\u00bb0px||0px||false|false\u00a0\u00bb locked=\u00a0\u00bboff\u00a0\u00bb global_colors_info=\u00a0\u00bb{}\u00a0\u00bb][et_pb_row column_structure=\u00a0\u00bb1_4,3_4&Prime; _builder_version=\u00a0\u00bb4.27.0&Prime; _module_preset=\u00a0\u00bbdefault\u00a0\u00bb custom_padding=\u00a0\u00bb50px||||false|false\u00a0\u00bb custom_css_main_element=\u00a0\u00bbz-index:0!important;\u00a0\u00bb global_colors_info=\u00a0\u00bb{}\u00a0\u00bb][et_pb_column type=\u00a0\u00bb1_4&Prime; disabled_on=\u00a0\u00bbon|on|off\u00a0\u00bb _builder_version=\u00a0\u00bb4.22.0&Prime; _module_preset=\u00a0\u00bbdefault\u00a0\u00bb custom_padding=\u00a0\u00bb||||false|false\u00a0\u00bb sticky_position=\u00a0\u00bbtop\u00a0\u00bb sticky_offset_top=\u00a0\u00bb100px\u00a0\u00bb sticky_limit_bottom=\u00a0\u00bbsection\u00a0\u00bb motion_trigger_start=\u00a0\u00bbtop\u00a0\u00bb global_colors_info=\u00a0\u00bb{}\u00a0\u00bb][et_pb_text admin_label=\u00a0\u00bbindice\u00a0\u00bb _builder_version=\u00a0\u00bb4.27.6&Prime; _module_preset=\u00a0\u00bbdefault\u00a0\u00bb custom_margin=\u00a0\u00bb||0px||false|false\u00a0\u00bb custom_padding=\u00a0\u00bb||14px||false|false\u00a0\u00bb link_option_url=\u00a0\u00bb#1&Prime; global_colors_info=\u00a0\u00bb{}\u00a0\u00bb]<\/p>\n<p style=\"font-size: 0.9em; line-height: 1.4em; color: #333333;\"><strong>Sections<\/strong><\/p>\n<ul class=\"ittopicsul\">\n<li><a href=\"#1\">Qu\u2019est-ce que le GPU monitoring<\/a><\/li>\n<li><a href=\"#2\">Pourquoi le GPU monitoring est important<\/a><\/li>\n<li><a href=\"#3\">Environnements on-premise, hybrides et enterprise<\/a><\/li>\n<li><a href=\"#4\">Les m\u00e9triques cl\u00e9s du GPU monitoring<\/a><\/li>\n<li><a href=\"#5\">nvidia-smi, DCGM et plateformes de monitoring<\/a><\/li>\n<li><a href=\"#6\">Les risques li\u00e9s \u00e0 l\u2019absence de monitoring des GPU<\/a><\/li>\n<li><a href=\"#7\">Des m\u00e9triques isol\u00e9es \u00e0 la corr\u00e9lation op\u00e9rationnelle<\/a><\/li>\n<li><a href=\"#8\">Comment Pandora FMS aide au GPU monitoring<\/a><\/li>\n<li><a href=\"#9\">Seuils, alertes et \u00e9tats critiques<\/a><\/li>\n<li><a href=\"#10\">Comment Pandora FMS aide \u00e0 monitorer les bases de donn\u00e9es<\/a><\/li>\n<li><a href=\"#11\">Compatibilit\u00e9 et pr\u00e9requis du plugin Pandora FMS<\/a><\/li>\n<li><a href=\"#12\">GPU monitoring et planification de capacit\u00e9<\/a><\/li>\n<li><a href=\"#13\">Une composante du monitoring d\u2019infrastructure IA<\/a><\/li>\n<li><a href=\"#14\">Conclusion<\/a><\/li>\n<li><a href=\"#15\">Questions fr\u00e9quentes<\/a><\/li>\n<\/ul>\n<p>[\/et_pb_text][\/et_pb_column][et_pb_column type=\u00a0\u00bb3_4&Prime; _builder_version=\u00a0\u00bb4.27.0&Prime; _module_preset=\u00a0\u00bbdefault\u00a0\u00bb custom_css_main_element=\u00a0\u00bbz-index:0!important;\u00a0\u00bb global_colors_info=\u00a0\u00bb{}\u00a0\u00bb][et_pb_text admin_label=\u00a0\u00bbseccion\u00a0\u00bb module_id=\u00a0\u00bb1&Prime; module_class=\u00a0\u00bbittopicscontent\u00a0\u00bb _builder_version=\u00a0\u00bb4.27.6&Prime; _module_preset=\u00a0\u00bbdefault\u00a0\u00bb z_index=\u00a0\u00bb0&Prime; custom_margin=\u00a0\u00bb0px||0px||true|false\u00a0\u00bb custom_padding=\u00a0\u00bb0px||0px||false|false\u00a0\u00bb custom_css_main_element=\u00a0\u00bbfont-family:%22Pandora-Light%22;\u00a0\u00bb locked=\u00a0\u00bboff\u00a0\u00bb global_colors_info=\u00a0\u00bb{}\u00a0\u00bb]Au bon vieux temps, comme diraient certains, lorsqu\u2019il n\u2019\u00e9tait pas n\u00e9cessaire de contracter un pr\u00eat immobilier pour en acheter une, le GPU (Graphics Processing Unit) \u00e9tait ce composant qui n\u2019int\u00e9ressait que ceux qui voulaient jouer \u00e0 Crysis en pleine r\u00e9solution. <strong>Aujourd\u2019hui, c\u2019est le r\u00e9acteur \u00e0 antimati\u00e8re qui propulse la moiti\u00e9 de l\u2019industrie<\/strong> : entra\u00eenement de mod\u00e8les d\u2019IA, inf\u00e9rence, machine learning, simulation, rendu, analyse de donn\u00e9es et HPC (High-Performance Computing). <strong>Sans GPU, pas d\u2019IA<\/strong>, et sans IA, selon les visionnaires (qui la vendent), pas d\u2019avenir. Un avenir qui, selon ces m\u00eames personnes, pourrait de toute fa\u00e7on \u00eatre d\u00e9truit par cette m\u00eame intelligence artificielle.<br \/>\nMais dans de nombreux cas, <strong>le c\u0153ur de diamant de l\u2019infrastructure reste sans supervision<\/strong>.<br \/>\nLes serveurs, les CPU, le r\u00e9seau, les services&#8230; sont monitor\u00e9s avec un \u0153il de faucon, mais <strong>les GPU restent l\u2019angle mort le plus co\u00fbteux<\/strong>, celui qui, s\u2019il est laiss\u00e9 sans surveillance, peut se transformer en gouffre financier.<br \/>\nC\u2019est pourquoi le v\u00e9ritable d\u00e9fi n\u2019est pas seulement de mesurer le GPU, mais <strong>de l\u2019int\u00e9grer au monitoring des infrastructures on-premise, hybrides et cloud<\/strong>.<br \/>\nVoyons comment.<\/p>\n<h2 id=\"2\">Pourquoi le GPU monitoring est important dans les infrastructures d\u2019IA<\/h2>\n<p>Les GPU servent \u00e0 acc\u00e9l\u00e9rer les op\u00e9rations critiques d\u2019une organisation, mais comme rien n\u2019est gratuit dans la vie, ils introduisent en contrepartie de nouveaux risques op\u00e9rationnels. Cela en fait \u00e0 la fois le moteur de tout projet d\u2019IA et son talon d\u2019Achille.<br \/>\nPourquoi ?<\/p>\n<ul class=\"lista\">\n<li><strong>Parce qu\u2019il s\u2019agit de ressources de plus en plus co\u00fbteuses et limit\u00e9es<\/strong>. Chaque carte inactive ou satur\u00e9e, tout comme chaque minute de downtime, repr\u00e9sente de l\u2019argent qui part \u00e0 l\u2019\u00e9gout.<\/li>\n<li><strong>La saturation affecte l\u2019inf\u00e9rence et l\u2019entra\u00eenement<\/strong>. Un GPU qui souffle \u00e0 la limite ralentit les r\u00e9ponses et allonge des t\u00e2ches qui, d\u00e9j\u00e0, prennent du temps.<\/li>\n<li><strong>Le manque de m\u00e9moire provoque des erreurs ou une d\u00e9gradation<\/strong>. Une erreur out of memory au milieu d\u2019un entra\u00eenement, c\u2019est l\u2019\u00e9cran bleu de la mort de notre \u00e9poque, mais en beaucoup plus co\u00fbteux.<\/li>\n<li><strong>La temp\u00e9rature a un impact sur les performances et la disponibilit\u00e9<\/strong>, car, comme chez les humains, la chaleur d\u00e9grade, et trop de chaleur finit par tout arr\u00eater.<\/li>\n<li><strong>La sous-utilisation rend plus difficile la justification de l\u2019investissement<\/strong> et oblige \u00e0 fournir des explications lorsque la direction regarde la colonne des d\u00e9penses qui occupe trois feuilles de papier continu.<\/li>\n<li><strong>L\u2019historique permet de prendre des d\u00e9cisions de capacit\u00e9<\/strong>, mais le manque de visibilit\u00e9 complique les op\u00e9rations dans les environnements hybrides, on-premise et cloud.<\/li>\n<\/ul>\n<p>La conclusion est que laisser le GPU en dehors de la photo de famille du monitoring rel\u00e8ve de la folie \u00e0 notre \u00e9poque.<\/p>\n<h2 id=\"3\">Le v\u00e9ritable angle mort : GPU monitoring pour les environnements on-premise, hybrides et enterprise<\/h2>\n<p>Il existe une croyance r\u00e9pandue selon laquelle l\u2019IA vit dans le cloud, dans un centre de donn\u00e9es g\u00e9r\u00e9 par d\u2019autres et qui d\u00e9vaste un \u00e9cosyst\u00e8me \u00e9loign\u00e9 du n\u00f4tre. Pourtant, de tr\u00e8s nombreuses organisations exploitent des GPU dans leurs propres datacenters, dans des environnements hybrides, des centres de recherche, l\u2019industrie, des instances cloud avec GPU&#8230;<br \/>\nEt beaucoup de ces organisations <strong>op\u00e8rent sous des exigences de confidentialit\u00e9, de souverainet\u00e9 des donn\u00e9es ou de r\u00e9glementations sur celles-ci<\/strong>, o\u00f9 une solution 100 % cloud n\u2019est pas viable, sous peine d\u2019amende ou de risque de fuites dangereuses.<br \/>\nDans ces cas, il ne suffit pas d\u2019installer Ollama ou des outils similaires puis d\u2019oublier le sujet, et la documentation du moment d\u2019un fournisseur cloud ne suffit pas non plus pour op\u00e9rer avec garantie et efficacit\u00e9.<br \/>\nIl nous faut une plateforme capable de <strong>surveiller l\u2019ensemble, les GPU et le reste de l\u2019infrastructure<\/strong>, que ce soit sur des <a href=\"https:\/\/pandorafms.com\/fr\/surveillance-des-serveurs\/\" target=\"_blank\" rel=\"noopener\">serveurs propres<\/a> ou dans des <a href=\"https:\/\/pandorafms.com\/fr\/surveillance-virtualisation\/\" target=\"_blank\" rel=\"noopener\">environnements virtuels<\/A>.<br \/>\nLe d\u00e9bat sans fin entre <a href=\"https:\/\/pandorafms.com\/fr\/blog\/on-premise-vs-saas-2025\/\" target=\"_blank\" rel=\"noopener\">on-premise et SaaS<\/a>, ou les exigences des <a href=\"https:\/\/pandorafms.com\/fr\/blog\/surveillance-infrastructure-hyperconvergee\/\" target=\"_blank\" rel=\"noopener\">infrastructures hyperconverg\u00e9es<\/a>, renforce notre besoin de contr\u00f4le. Car un GPU peut vivre on-premise, dans un \u00e9cosyst\u00e8me hybride ou dans une instance cloud, mais <strong>son impact touche les services, le r\u00e9seau, les processus, les API, les applications<\/strong>&#8230;.<br \/>\nD\u2019o\u00f9 la n\u00e9cessit\u00e9 de se rapprocher un peu pour que le GPU entre dans cette photo de famille et de <strong>l\u2019inclure dans le monitoring global<\/strong>, et non comme une m\u00e9trique isol\u00e9e dans un onglet que personne n\u2019ouvre.<br \/>\nEt en parlant d\u2019elles&#8230;<\/p>\n<h2 id=\"4\">Les m\u00e9triques cl\u00e9s du GPU monitoring<\/h2>\n<p>Nous devons surveiller, tr\u00e8s bien, mais quoi exactement ?<br \/>\n<strong>Les m\u00e9triques d\u2019une strat\u00e9gie de GPU monitoring<\/strong> digne de ce nom sont, en plus de leur nombre et de leurs noms :<\/p>\n<ul class=\"lista\">\n<li><strong>\u00c9tat du GPU<\/strong> (son \u00e9tat op\u00e9rationnel).<\/li>\n<li><strong>Utilisation du GPU<\/strong> (en pourcentage d\u2019utilisation).<\/li>\n<li><strong>M\u00e9moire du GPU utilis\u00e9e \/ libre \/ totale<\/strong> (\u00e9tat g\u00e9n\u00e9ral de la m\u00e9moire, aussi bien en valeur brute qu\u2019en pourcentage).<\/li>\n<li><strong>Temp\u00e9rature<\/strong> du GPU pour savoir si le r\u00e9acteur de distorsion de l\u2019IA va exploser ou non.<\/li>\n<li><strong>\u00c9nergie consomm\u00e9e<\/strong> et limite de puissance pour \u00e9viter des factures grandes comme la cape de Superman.<\/li>\n<li><strong>Vitesse du ventilateur<\/strong> lorsque cela s\u2019applique, bien s\u00fbr, comme nous allons le voir tout de suite.<\/li>\n<li><strong>Erreurs<\/strong> critiques.<\/li>\n<li><strong>Versions du driver<\/strong> NVIDIA et de CUDA.<\/li>\n<\/ul>\n<p>Quelques nuances, car c\u2019est l\u00e0 que se cachent les d\u00e9tails qui nous \u00e9viteront de mauvaises surprises.<br \/>\n<strong>Les erreurs critiques ne sont pas une m\u00e9trique universelle<\/strong>. Dans un centre de donn\u00e9es avec prise en charge ECC, comme les A100, H100, Tesla ou RTX PRO, elles sont pertinentes, mais sur des cartes grand public, comme une GeForce RTX ou des mod\u00e8les similaires, l\u2019utilitaire en ligne de commande de NVIDIA <span style=\"color:green; font-family:Pandocode;\">nvidia-smi<\/span> peut renvoyer N\/A pour les erreurs ECC.<br \/>\nAinsi, notre plugin Pandora FMS, par exemple, \u00e9mettra 0 par conception. Ce z\u00e9ro \u00e9ternel ne signifie pas que la carte est immortelle, simplement qu\u2019il n\u2019y a rien \u00e0 compter.<br \/>\nD\u2019autre part, la vitesse du ventilateur <strong>n\u2019a de sens que sur les cartes avec ventilation active<\/strong> (D\u2019oh, comme dirait Homer Simpson). Sur des GPU serveur ou des environnements fanless, elle ne s\u2019applique \u00e9videmment pas.<br \/>\nC\u2019est pourquoi un plugin de monitoring comme le n\u00f4tre permet d\u2019ignorer ce module avec <span style=\"color:green; font-family:Pandocode;\">&#8211;include-fan=false<\/span>, car la <a href=\"https:\/\/pandorafms.com\/fr\/it-topics\/gestion-telemetrie-infrastructures-pandora-fms\/\" target=\"_blank\" rel=\"noopener\">t\u00e9l\u00e9m\u00e9trie avanc\u00e9e<\/a> consiste aussi \u00e0 savoir quoi ne pas mesurer pour ne pas saturer le syst\u00e8me avec du bruit.<\/p>\n<h2 id=\"5\">nvidia-smi, DCGM et plateformes de monitoring : ce que chacune apporte<\/h2>\n<p>Nous avons d\u00e9j\u00e0 vu le quoi, <strong>il est maintenant temps de voir comment nous monitorons<\/strong> et aussi de diff\u00e9rencier les outils, car ils se confondent facilement.<br \/>\nAnalysons ce que chacun apporte.<br \/>\nD\u2019un c\u00f4t\u00e9, nous avons <span style=\"font-family:Pandocode;\"><a href=\"https:\/\/docs.nvidia.com\/deploy\/nvidia-smi\/\" target=\"_blank\" rel=\"noopener nofollow\">nvidia-smi<\/A><\/span>, qui a d\u00e9j\u00e0 point\u00e9 le bout de son nez et qui est <strong>l\u2019utilitaire en ligne de commande permettant de consulter les informations des GPU NVIDIA<\/strong>. Il s\u2019agit de leur utilisation, m\u00e9moire, temp\u00e9rature, consommation, processus, driver, <a href=\"https:\/\/docs.nvidia.com\/cuda\/\" target=\"_blank\" rel=\"noopener nofollow\">CUDA<\/A>\u2026<br \/>\nC\u2019est le tricordeur du GPU : vous le pointez, vous lisez une valeur et vous continuez votre chemin. <strong>Parfait pour un diagnostic ponctuel ou un script lanc\u00e9 au c\u0153ur de la nuit<\/strong>.<br \/>\n<a href=\"https:\/\/developer.nvidia.com\/dcgm\" target=\"_blank\" rel=\"noopener nofollow\">NVIDIA DCGM<\/a> est orient\u00e9 vers la <strong>gestion des GPU dans les centres de donn\u00e9es, les clusters et les d\u00e9ploiements avanc\u00e9s<\/strong>. Nous disposons ici de capteurs plus \u00e9tendus pour notre vaisseau spatial, car il est utile lorsqu\u2019il y a beaucoup de GPU ou une int\u00e9gration avec des stacks d\u2019observabilit\u00e9.<br \/>\nLes deux sont de bons outils, mais la v\u00e9rit\u00e9 est que <strong>ni <span style=\"color:green; font-family:Pandocode;\">nvidia-smi<\/span> ni DCGM ne vont r\u00e9soudre toute l\u2019exploitation IT \u00e0 notre place<\/strong>.<br \/>\nIls ne centralisent pas l\u2019infrastructure, ne remplacent pas les dashboards d\u2019entreprise, n\u2019apportent pas de reporting historique orient\u00e9 m\u00e9tier et ne corr\u00e8lent pas \u00e0 eux seuls GPU avec CPU, RAM, disque, r\u00e9seau, logs, services ou SLA, par exemple.<br \/>\nPour ces raisons, des propositions comme celle de <a href=\"https:\/\/www.datadoghq.com\/product\/gpu-monitoring\/\" target=\"_blank\" rel=\"noopener nofollow\">Datadog<\/a> insistent sur la connexion du GPU avec le reste de l\u2019AI workload.<br \/>\nOu, pour le dire autrement afin que ce soit clair. <span style=\"color:green; font-family:Pandocode;\">nvidia-smi<\/span> <strong>et DCGM peuvent \u00eatre d\u2019excellentes sources de donn\u00e9es, mais flottant seules dans le vide<\/strong>.<br \/>\nC\u2019est une plateforme comme <strong>Pandora FMS qui les transforme en connaissance op\u00e9rationnelle exploitable<\/strong>, avec historique, alertes, dashboards, rapports, corr\u00e9lation et d\u00e9cisions de capacit\u00e9.<br \/>\nLe tricordeur fournit une lecture ; une passerelle de commandement de l\u2019Enterprise comme Pandora FMS vous indique ce qu\u2019elle signifie dans le contexte de tout le reste lorsqu\u2019elle int\u00e8gre cette lecture.<br \/>\nEt en situation de crise, vous voulez \u00eatre sur la passerelle, pas en train de d\u00e9chiffrer des donn\u00e9es isol\u00e9es dans l\u2019obscurit\u00e9.<\/p>\n<h2 id=\"6\">Les risques li\u00e9s \u00e0 l\u2019absence de monitoring des GPU<\/h2>\n<p>Laisser le moteur sans surveillance a des cons\u00e9quences d\u00e9sastreuses, comme :<\/p>\n<ul class=\"lista\">\n<li><strong>Saturation invisible<\/strong>, celle que l\u2019on d\u00e9couvre seulement lorsqu\u2019elle fait d\u00e9j\u00e0 mal.<\/li>\n<li><strong>D\u00e9gradation des services<\/strong>, affectant l\u2019inf\u00e9rence et entra\u00eenant des entra\u00eenements plus lents ou \u00e9chou\u00e9s.<\/li>\n<li><strong>Erreurs CUDA<\/strong> qui passent inaper\u00e7ues.<\/li>\n<li><strong>Surchauffe et factures d\u2019\u00e9lectricit\u00e9<\/strong> interminables.<\/li>\n<li><strong>Achat inutile<\/strong> de mat\u00e9riel ou <strong>sous-utilisation<\/strong> de celui d\u00e9j\u00e0 pay\u00e9.<\/li>\n<li><strong>Difficult\u00e9s \u00e0 relier les incidents applicatifs<\/strong> \u00e0 la pression r\u00e9elle exerc\u00e9e sur l\u2019infrastructure.<\/li>\n<\/ul>\n<p>C\u2019est le sc\u00e9nario de tant de films catastrophe : les signaux \u00e9taient l\u00e0, clignotant sur un panneau, mais personne ne les regardait.<\/p>\n<h2 id=\"7\">Des m\u00e9triques isol\u00e9es \u00e0 la corr\u00e9lation op\u00e9rationnelle<\/h2>\n<p>Le GPU monitoring isol\u00e9 est un thermom\u00e8tre qui, avec la <strong>corr\u00e9lation op\u00e9rationnelle issue de son int\u00e9gration au monitoring global<\/strong>, devient diagnostic et connaissance op\u00e9rationnelle.<br \/>\nSavoir qu\u2019un GPU est \u00e0 95 % ne dit pas grand-chose, tout comme la fi\u00e8vre seule n\u2019en r\u00e9v\u00e8le pas la cause. <strong>Ce qui compte, c\u2019est le contexte<\/strong>.<br \/>\nPour reprendre l\u2019exemple, un GPU \u00e0 95 % pendant dix minutes peut \u00eatre normal, mais le m\u00eame GPU \u00e0 95 % pendant quatre heures, avec une m\u00e9moire au-dessus de 85 %, des erreurs apparaissant dans les logs et une latence de service d\u2019inf\u00e9rence en hausse, constitue un <strong>incident op\u00e9rationnel<\/strong>.<br \/>\nAutre exemple : la temp\u00e9rature. Une valeur \u00e9lev\u00e9e associ\u00e9e \u00e0 un ventilateur tournant \u00e0 warp 9 et \u00e0 des performances au ras du sol peut anticiper une d\u00e9faillance physique, une br\u00e8che dans la muraille qui fera s\u2019effondrer le ch\u00e2teau si elle est ignor\u00e9e.<br \/>\n<strong>Connecter ces signaux, c\u2019est ce qui distingue un outil qui regarde d\u2019une plateforme qui comprend.<\/strong><br \/>\nC\u2019est la mati\u00e8re de l\u2019<a href=\"https:\/\/pandorafms.com\/fr\/blog\/analyse-cause-racine\/\" target=\"_blank\" rel=\"noopener\">analyse de cause racine<\/a>, du travail quotidien de tout <a href=\"https:\/\/pandorafms.com\/fr\/it-topics\/network-operations-center\/\" target=\"_blank\" rel=\"noopener\">Network Operations Center<\/a> ou de toute \u00e9quipe <a href=\"https:\/\/pandorafms.com\/fr\/it-topics\/sre\/\" target=\"_blank\" rel=\"noopener\">SRE<\/a> qui prend au s\u00e9rieux le <a href=\"https:\/\/pandorafms.com\/fr\/it-topics\/monitoring-systeme-it\/\" target=\"_blank\" rel=\"noopener\">monitoring des syst\u00e8mes IT<\/a>.<\/p>\n<h2 id=\"8\">Comment Pandora FMS aide au GPU monitoring<\/h2>\n<p>En technologie, soit vous \u00eates \u00e0 la pointe, soit vous n\u2019y \u00eates pas vraiment.<br \/>\nC\u2019est la philosophie de <a href=\"https:\/\/pandorafms.com\/fr\/\" target=\"_blank\" rel=\"noopener\">Pandora FMS<\/a>, et c\u2019est pourquoi l\u2019application <strong>permet d\u2019int\u00e9grer les m\u00e9triques GPU<\/strong> dans la m\u00eame console o\u00f9 sont d\u00e9j\u00e0 monitor\u00e9s les serveurs, les services, le r\u00e9seau, le stockage, les logs, les \u00e9v\u00e9nements et la disponibilit\u00e9.<br \/>\nCela fait de la surveillance des GPU non pas une note de bas de page, mais une pi\u00e8ce fondamentale d\u2019une m\u00e9canique <strong>optimis\u00e9e pour le monitoring et l\u2019observabilit\u00e9 dont une infrastructure IT professionnelle a besoin<\/strong>.<br \/>\nPour cela, Pandora FMS utilise <strong>un plugin sp\u00e9cialis\u00e9 en GPU monitoring<\/strong>.<br \/>\nCelui-ci s\u2019appuie sur <span style=\"color:green; font-family:Pandocode;\">nvidia-smi<\/Span> et fonctionne comme un plugin d\u2019agent local sur l\u2019h\u00f4te \u00e9quip\u00e9 d\u2019un GPU NVIDIA, en \u00e9mettant des modules que Pandora FMS int\u00e8gre au contexte de l\u2019agent.<br \/>\nAinsi, ces m\u00e9triques peuvent :<\/p>\n<ul class=\"lista\">\n<li>\u00catre visualis\u00e9es, \u00e9videmment.<\/li>\n<li>Composer un historique pour les tendances, les analyses ou tout autre besoin.<\/li>\n<li>D\u00e9clencher des alertes intelligentes.<\/li>\n<li>\u00catre incluses dans des rapports comme n\u2019importe quelle autre m\u00e9trique.<\/li>\n<\/ul>\n<p>En outre, les informations \u00e9mises sont critiques et n\u00e9cessaires \u00e0 la gestion optimale d\u2019un actif plus co\u00fbteux que l\u2019adamantium.<br \/>\nPour chaque GPU d\u00e9tect\u00e9, il \u00e9met notamment : <span style=\"color:green; font-family:Pandocode;\">GPU_&lt;i>_Status<\/span> (1 = sain, 0 = d\u00e9grad\u00e9), <span style=\"color:green; font-family:Pandocode;\">GPU_&lt;i>_Utilization<\/span>, <span style=\"color:green; font-family:Pandocode;\">GPU_&lt;i>_Memory_Used<\/span>, <span style=\"color:green; font-family:Pandocode;\">GPU_&lt;i>_Memory_Free<\/span>, <span style=\"color:green; font-family:Pandocode;\">GPU_&lt;i>_Memory_Total<\/Span> (en MiB, m\u00e9bioctets, pas en octets), <span style=\"color:green; font-family:Pandocode;\">GPU_&lt;i>_Memory_Used_Percent<\/Span>, <span style=\"color:green; font-family:Pandocode;\">GPU_&lt;i>_Temperature<\/Span> (\u00b0C), <span style=\"color:green; font-family:Pandocode;\">GPU_&lt;i>_Power_Draw<\/span> et <span style=\"color:green; font-family:Pandocode;\">GPU_&lt;i>_Power_Limit<\/span> (W), <span style=\"color:green; font-family:Pandocode;\">GPU_&lt;i>_Fan_Speed<\/Span> (optionnel), <span style=\"color:green; font-family:Pandocode;\">GPU_&lt;i>_Critical_Errors<\/span> et <span style=\"color:green; font-family:Pandocode;\">GPU_&lt;i>_Name<\/Span>.<br \/>\n\u00c0 l\u2019\u00e9chelle de l\u2019h\u00f4te, il ajoute trois modules globaux : <span style=\"color:green; font-family:Pandocode;\">GPU_Count<\/span>, <span style=\"color:green; font-family:Pandocode;\">GPU_Driver_Version<\/span> et <span style=\"color:green; font-family:Pandocode;\">GPU_CUDA_Version<\/span>.<br \/>\nLe total d\u00e9coule d\u2019une formule simple : <span style=\"color:green; font-family:Pandocode;\"><strong>12N + 3<\/strong><\/span> modules avec la vitesse du ventilateur, ou <span style=\"color:green; font-family:Pandocode;\"><strong>11N + 3<\/strong><\/span> sans elle, o\u00f9 N est le nombre de GPU de l\u2019h\u00f4te.<br \/>\nEt un d\u00e9tail en dit long sur la conception. <strong>Si <span style=\"color:green; font-family:Pandocode;\">nvidia-smi<\/Span> n\u2019est pas disponible, pas d\u2019inqui\u00e9tude, le plugin ne casse pas et ne produit pas de XML invalide<\/strong> ; il \u00e9met \u00e0 la place <span style=\"color:green; font-family:Pandocode;\">GPU_Count = 0<\/span> en \u00e9tat critique.<br \/>\nLe d\u00e9fi reste visible sous forme d\u2019alerte propre, et non comme ce silence suspect qui pourrait pr\u00e9parer la ruine.<br \/>\nNotre objectif, parce que nous avons v\u00e9cu nous-m\u00eames le chaos co\u00fbteux de la fragmentation, est que <strong>Pandora FMS permette d\u2019analyser tous ces signaux sur une m\u00eame plateforme<\/strong>, avec des alertes int\u00e9gr\u00e9es ou notre m\u00e9taconsole, par exemple, afin de disposer d\u2019un point unique de visibilit\u00e9 et de contr\u00f4le, au lieu de jongler entre commandes, logs et dashboards dispers\u00e9s.<\/p>\n<h2 id=\"9\">Seuils, alertes et \u00e9tats critiques<\/h2>\n<p>Pandora FMS est l\u00e0 pour \u00e9viter le d\u00e9sastre. Pour cela, elle soul\u00e8ve jusqu\u2019au dernier tapis et relie les points afin de vous offrir ce qui se rapproche le plus de la prescience des Atr\u00e9ides dans Dune. D\u2019o\u00f9 son syst\u00e8me de seuils et d\u2019alertes.<br \/>\nEt pour que nous puissions commencer imm\u00e9diatement sans tout cr\u00e9er de z\u00e9ro, une situation qui nous conduit souvent \u00e0 procrastiner sur ce qui compte, le plugin inclut des seuils pr\u00e9d\u00e9finis, disjoints, qui ne se chevauchent pas, et born\u00e9s, avec un plancher et un plafond clairs, pour les m\u00e9triques les plus sensibles :<\/p>\n<ul class=\"lista\">\n<li><span style=\"color:green; font-family:Pandocode;\"><strong>GPU_&lt;i>_Memory_Used_Percent<\/Strong><\/span> \u2014 Normal : 0-69 %. Warning : 70-84 %. Critical : 85-100 %.<\/li>\n<li><span style=\"color:green; font-family:Pandocode;\"><strong>GPU_&lt;i>_Temperature<\/Strong><\/span> \u2014 Normal : 0-69 \u00b0C. Warning : 70-89 \u00b0C. Critical : 90-110 \u00b0C.<\/li>\n<li><span style=\"color:green; font-family:Pandocode;\"><strong>GPU_&lt;i>_Critical_Errors<\/Strong><\/span> \u2014 Normal : 0. Critical : toute valeur sup\u00e9rieure \u00e0 0.<\/li>\n<\/ul>\n<p>Rappelons que cette erreur critique a du sens sur les cartes de datacenter avec ECC, o\u00f9 toute erreur non corrig\u00e9e doit \u00eatre trait\u00e9e comme prioritaire, sans demi-mesure. Sur les GPU grand public, cela ne s\u2019applique pas.<br \/>\nAvec ces seuils, nous d\u00e9tecterons la pression m\u00e9moire, le risque thermique et les erreurs critiques sans tomber dans l\u2019<a href=\"https:\/\/pandorafms.com\/fr\/blog\/exces-alertes-monitoring\/\" target=\"_blank\" rel=\"noopener\">exc\u00e8s d\u2019alertes<\/A>, ce bruit qui finit par faire que plus personne ne pr\u00eate attention \u00e0 rien.<br \/>\nEt si une organisation a besoin d\u2019autres valeurs, parfait. Nous pensons que chaque organisation est un monde \u00e0 part, ils peuvent donc \u00eatre ajust\u00e9s \u00e0 notre r\u00e9alit\u00e9 concr\u00e8te depuis la console elle-m\u00eame.<\/p>\n<h2 id=\"10\">Compatibilit\u00e9 et pr\u00e9requis du plugin Pandora FMS<\/h2>\n<p>\u00ab Des promesses qui ne valent rien&#8230; \u00bb, comme le dit la chanson. Chez Pandora FMS, nous ne les aimons pas du tout. Ainsi, pour \u00e9viter celles qui ne tiennent pas ensuite, <strong>il convient d\u2019\u00eatre clair sur ce que le plugin fait et ne fait pas<\/Strong> :<\/p>\n<ul class=\"lista\">\n<li>Il est orient\u00e9 vers les <strong>GPU NVIDIA<\/strong> et utilise <span style=\"color:green; font-family:Pandocode;\">nvidia-smi<\/Span> comme source de donn\u00e9es.<\/li>\n<li>Il fonctionne comme un <strong>plugin d\u2019agent local<\/strong> et n\u00e9cessite que le driver NVIDIA soit install\u00e9 et que <span style=\"color:green; font-family:Pandocode;\">nvidia-smi<\/Span> soit disponible.<\/li>\n<li>Il est <strong>compatible avec Linux et Windows<\/strong>.<\/li>\n<li>Dans le cloud, il fonctionne avec des instances GPU d\u2019<a href=\"https:\/\/pandorafms.com\/fr\/surveillance-amazon-web-services\/\" target=\"_blank\" rel=\"noopener\">AWS<\/a>, <a href=\"https:\/\/pandorafms.com\/fr\/surveillance-microsoft-azure\/\" target=\"_blank\" rel=\"noopener\">Azure<\/a> ou <a href=\"https:\/\/pandorafms.com\/fr\/surveillance-google-cloud\/\" target=\"_blank\" rel=\"noopener\">Google Cloud<\/a> <strong>\u00e0 condition que le GPU NVIDIA soit expos\u00e9 au syst\u00e8me d\u2019exploitation<\/strong> et que le driver soit correctement install\u00e9. Les fournisseurs documentent ce point, comme dans les guides de <a href=\"https:\/\/cloud.google.com\/compute\/docs\/gpus\/monitor-gpus\" target=\"_blank\" rel=\"noopener nofollow\">Google Cloud<\/A> ou d\u2019<a href=\"https:\/\/docs.aws.amazon.com\/dlami\/latest\/devguide\/tutorial-gpu-monitoring-gpumon.html\" target=\"_blank\" rel=\"noopener nofollow\">AWS<\/a>.<\/li>\n<li>Pour le moment, il <strong>ne prend pas en charge AMD ni Intel<\/strong>.<\/li>\n<li>Il ne monitore pas non plus les mod\u00e8les d\u2019IA, les prompts, le drift ni les m\u00e9triques MLOps.<\/li>\n<li><strong>L\u2019intervalle recommand\u00e9 de l\u2019agent est d\u2019au moins 30 secondes<\/strong>, bien que la valeur par d\u00e9faut de 300 secondes soit adapt\u00e9e \u00e0 la plupart des environnements.<\/li>\n<\/ul>\n<p>Et une nuance op\u00e9rationnelle. <strong>Le plugin est pens\u00e9 pour des h\u00f4tes individuels ou des environnements de taille moyenne<\/strong>.<br \/>\nSi votre cas concerne des clusters avec de nombreux GPU par n\u0153ud ou des architectures Kubernetes \u00e0 grande \u00e9chelle, il peut \u00eatre n\u00e9cessaire de le compl\u00e9ter avec des approches comme DCGM, Prometheus ou d\u2019autres solutions d\u2019agr\u00e9gation.<br \/>\nAucun outil ne fait tout, et le reconna\u00eetre nous semble honn\u00eate.<\/p>\n<h2 id=\"11\">GPU monitoring et planification de capacit\u00e9 (capacity planning)<\/h2>\n<p>Compte tenu du nombre de premiers-n\u00e9s que nous devons sacrifier au Dieu Machine pour pouvoir nous offrir un GPU, <strong>tout ce qui pr\u00e9c\u00e8de est largement justifi\u00e9<\/Strong>. Soit nous monitorons, soit le point le plus critique devient un angle mort.<br \/>\nMais <strong>c\u2019est dans le capacity planning que le monitoring se traduit en euros sonnants et tr\u00e9buchants<\/strong>.<br \/>\nGr\u00e2ce \u00e0 l\u2019historique d\u2019utilisation, de m\u00e9moire, de temp\u00e9rature et de consommation, il est possible de d\u00e9tecter les GPU satur\u00e9s de fa\u00e7on r\u00e9currente, d\u2019identifier ceux qui sont sous-utilis\u00e9s, de redistribuer les charges et de justifier les acquisitions aupr\u00e8s du service achats avec des donn\u00e9es, plut\u00f4t qu\u2019avec des intuitions et des supplications, car nous pourrons mesurer la croissance r\u00e9elle de la demande.<br \/>\nAu final, c\u2019est de la <a href=\"https:\/\/pandorafms.com\/fr\/it-topics\/science-des-donnees-it\/\" target=\"_blank\" rel=\"noopener\">science des donn\u00e9es appliqu\u00e9e \u00e0 l\u2019IT<\/a> et une mani\u00e8re de transformer le pass\u00e9 en d\u00e9cisions.<\/p>\n<h2 id=\"12\">Le monitoring des GPU comme partie d\u2019un monitoring d\u2019infrastructure IA (AI infrastructure monitoring)<\/h2>\n<p>On parle g\u00e9n\u00e9ralement des GPU parce qu\u2019\u00e0 notre \u00e9poque ils se sont hiss\u00e9s au sommet de nombreuses infrastructures IT, <strong>mais ils ne jouent pas seuls le match<\/Strong>.<br \/>\nUne infrastructure IA d\u00e9pend aussi du CPU, de la RAM, du disque, du stockage, du r\u00e9seau, des API, des services, des logs, des processus, des conteneurs, des bases de donn\u00e9es et de la disponibilit\u00e9 de l\u2019ensemble.<br \/>\nC\u2019est pourquoi <strong>le GPU monitoring doit faire partie d\u2019une strat\u00e9gie plus large d\u2019AI infrastructure monitoring<\/strong>.<br \/>\nSurveiller uniquement le GPU, c\u2019est comme piloter l\u2019Enterprise en ne pr\u00eatant attention qu\u2019\u00e0 ce qui se passe dans le moteur \u00e0 antimati\u00e8re, tout en ignorant les boucliers, le support vital ou m\u00eame le cap.<br \/>\nC\u2019est l\u00e0 que Pandora FMS devient ce l\u00e9gendaire ordinateur de bord qui savait tout.<br \/>\nPandora int\u00e8gre cette visibilit\u00e9 dans une exploitation IT compl\u00e8te, o\u00f9 l\u2019<a href=\"https:\/\/pandorafms.com\/fr\/ia-management-it-intelligent-monitoring\/\" target=\"_blank\" rel=\"noopener\">IA appliqu\u00e9e \u00e0 la gestion<\/a>, l\u2019<a href=\"https:\/\/pandorafms.com\/fr\/it-topics\/ia-generative-gestion-it\/\" target=\"_blank\" rel=\"noopener\">IA g\u00e9n\u00e9rative<\/a> et le <a href=\"https:\/\/pandorafms.com\/fr\/it-topics\/deep-learning-monitoring-itsm\/\" target=\"_blank\" rel=\"noopener\">deep learning<\/a> apportent l\u2019analyse que, reconnaissons-le en tant qu\u2019esp\u00e8ce, aucun humain ne pourrait maintenir manuellement, ni n\u2019aurait envie de le faire, car il n\u2019y en a pas besoin.<br \/>\nC\u2019est particuli\u00e8rement pertinent dans les <a href=\"https:\/\/pandorafms.com\/fr\/blog\/centres-donnees-intelligents-2\/\" target=\"_blank\" rel=\"noopener\">centres de donn\u00e9es<\/a>, o\u00f9 la disponibilit\u00e9 est consid\u00e9r\u00e9e comme acquise jusqu\u2019\u00e0 ce qu\u2019elle cesse de l\u2019\u00eatre, comme le sait bien toute bonne strat\u00e9gie d\u2019<a href=\"https:\/\/pandorafms.com\/fr\/it-topics\/uptime-monitoring\/\" target=\"_blank\" rel=\"noopener\">uptime monitoring<\/a>.<\/p>\n<h2 id=\"13\">Conclusion<\/h2>\n<p>Nous avons beaucoup parl\u00e9, mais concentrons-nous sur trois id\u00e9es \u00e0 retenir.<\/p>\n<ul class=\"lista\">\n<li>Que <strong>les GPU sont des ressources critiques<\/Strong> dans les infrastructures d\u2019IA et HPC, et non un simple d\u00e9tail technique.<\/li>\n<li>Que <strong>les monitorer de mani\u00e8re isol\u00e9e ne suffit pas<\/Strong>, car une valeur sans contexte n\u2019est que du bruit.<\/li>\n<li><strong>Que la valeur r\u00e9side dans leur int\u00e9gration au monitoring global de l\u2019infrastructure<\/Strong>, o\u00f9 une m\u00e9trique GPU dialogue avec les serveurs, les services, le r\u00e9seau, les logs et les alertes.<\/li>\n<\/ul>\n<p>Les outils NVIDIA fournissent la lecture, <Strong>mais il faut une passerelle de commandement pour l\u2019interpr\u00e9ter<\/Strong>.<br \/>\nPandora FMS aspire \u00e0 \u00eatre cette passerelle pour amener le GPU monitoring aux environnements on-premise, hybrides et enterprise. Car dans les interstices de l\u2019IT vivent les gremlins de la machine, <Strong>ceux qui vous causent des ennuis pr\u00e9cis\u00e9ment l\u00e0 o\u00f9 vous ne surveillez pas<\/Strong>.<\/p>\n<h2 id=\"14\">Questions fr\u00e9quentes<\/h2>\n<p>Rassemblons les questions les plus importantes sur le monitoring des GPU et leurs r\u00e9ponses.<\/p>\n<h4>Qu\u2019est-ce que le GPU monitoring ?<\/h4>\n<p>Le GPU monitoring est <strong>la supervision continue de l\u2019\u00e9tat, de l\u2019utilisation, de la m\u00e9moire, de la temp\u00e9rature, de la consommation et des erreurs des unit\u00e9s de traitement graphique dans des environnements professionnels<\/Strong>.<br \/>\nIl est utilis\u00e9 pour contr\u00f4ler les GPU employ\u00e9s dans l\u2019IA, le HPC, l\u2019inf\u00e9rence, l\u2019entra\u00eenement de mod\u00e8les ou le traitement intensif.<br \/>\nComme je l\u2019ai indiqu\u00e9 au d\u00e9but, il ne doit pas \u00eatre confondu avec les outils de gaming, d\u2019overclocking ou de tuning graphique.<\/p>\n<h4>Pourquoi est-il important de monitorer les GPU dans les infrastructures d\u2019IA ?<\/h4>\n<p>Parce que les GPU font battre le c\u0153ur et sont, en plus, des <Strong>ressources tr\u00e8s co\u00fbteuses et critiques<\/Strong> pour les charges d\u2019inf\u00e9rence, d\u2019entra\u00eenement et de machine learning.<br \/>\n<Strong>Sans monitoring, nous sommes aveugles sur notre actif le plus critique<\/Strong>, le laissant sans d\u00e9fense face \u00e0 la saturation, la surchauffe, les erreurs ou la sous-utilisation, qui ont la f\u00e2cheuse habitude d\u2019attaquer cach\u00e9es dans les ombres et les zones que nous laissons sans surveillance.<br \/>\nCela augmente le risque op\u00e9rationnel et complique l\u2019approbation de nouveaux investissements mat\u00e9riels par le d\u00e9partement financier.<\/p>\n<h4>Quelles m\u00e9triques faut-il monitorer sur un GPU ?<\/h4>\n<p>Les principales sont l\u2019utilisation, la m\u00e9moire utilis\u00e9e, libre et totale, le pourcentage de m\u00e9moire utilis\u00e9e, la temp\u00e9rature, la consommation instantan\u00e9e, la limite de consommation, la vitesse du ventilateur, l\u2019\u00e9tat, les erreurs ECC critiques, le mod\u00e8le de GPU, la version du driver et la version CUDA.<br \/>\nPresque rien, mais isol\u00e9es, elles nous donnent un puzzle non assembl\u00e9. Ainsi, <Strong>dans les environnements professionnels, ces m\u00e9triques doivent \u00eatre analys\u00e9es avec le reste<\/Strong> de l\u2019infrastructure.<\/p>\n<h4>Quelle est la diff\u00e9rence entre nvidia-smi, DCGM et une plateforme de monitoring ?<\/h4>\n<p><span style=\"color:green; font-family:Pandocode;\">nvidia-smi<\/span> est un utilitaire en ligne de commande permettant de consulter des m\u00e9triques ponctuelles des GPU NVIDIA.<br \/>\nDCGM est orient\u00e9 vers la gestion et le monitoring des GPU dans les datacenters et les clusters.<br \/>\nUne plateforme comme Pandora FMS <Strong>centralise ces m\u00e9triques avec le reste de l\u2019infrastructure<\/Strong>, avec historique, alertes, dashboards et rapports.<\/p>\n<h4>\u00c0 partir de quelle temp\u00e9rature un GPU serveur est-il consid\u00e9r\u00e9 comme critique ?<\/h4>\n<p>D\u2019apr\u00e8s notre exp\u00e9rience int\u00e9gr\u00e9e au plugin de GPU monitoring de Pandora FMS, <Strong>une temp\u00e9rature \u00e0 partir de 70 \u00b0C est consid\u00e9r\u00e9e comme warning et, \u00e0 partir de 90 \u00b0C, comme critical<\/Strong>.<br \/>\nCes seuils servent de r\u00e9f\u00e9rence op\u00e9rationnelle, m\u00eame s\u2019ils peuvent varier selon le mod\u00e8le de GPU, le fabricant et les conditions thermiques de l\u2019environnement.<\/p>\n<h4>Que sont les erreurs ECC dans un GPU et pourquoi sont-elles importantes ?<\/h4>\n<p>Les erreurs ECC (Error-Correcting Code) sont des <Strong>erreurs de m\u00e9moire d\u00e9tect\u00e9es dans les GPU avec prise en charge ECC<\/Strong>.<br \/>\nLes erreurs non corrig\u00e9es peuvent indiquer des d\u00e9faillances mat\u00e9rielles et doivent \u00eatre trait\u00e9es comme des incidents critiques.<br \/>\nElles sont particuli\u00e8rement pertinentes sur les GPU de datacenter comme A100, H100, Tesla ou RTX PRO. Sur les GPU grand public, le module est tout de m\u00eame \u00e9mis, mais avec une valeur 0 dans le plugin Pandora FMS, car il n\u2019y a pas d\u2019erreurs ECC \u00e0 compter.<\/p>\n<h4>Peut-on monitorer des GPU dans des environnements on-premise avec Pandora FMS ?<\/h4>\n<p>Oui. <Strong>Pandora FMS dispose d\u2019un plugin d\u2019agent local bas\u00e9 sur <span style=\"color:green; font-family:Pandocode;\">nvidia-smi<\/span>, qui permet de monitorer des GPU NVIDIA sur des serveurs on-premise<\/Strong>.<br \/>\nIl peut \u00e9galement \u00eatre utilis\u00e9 dans des environnements hybrides ou des instances cloud si le GPU NVIDIA est expos\u00e9 au syst\u00e8me d\u2019exploitation et si le driver est correctement install\u00e9.<\/p>\n<h4>Comment le GPU monitoring aide-t-il au capacity planning ?<\/h4>\n<p>L\u2019historique d\u2019utilisation, de m\u00e9moire, de temp\u00e9rature et de consommation permet d\u2019identifier les <Strong>GPU satur\u00e9s de fa\u00e7on r\u00e9currente, de d\u00e9tecter la sous-utilisation et de redistribuer<\/Strong> les charges.<br \/>\nIl <Strong>aide aussi \u00e0 justifier les achats de mat\u00e9riel<\/Strong> ou \u00e0 reporter des extensions inutiles avec des donn\u00e9es objectives d\u2019utilisation et de capacit\u00e9 en main.<\/p>\n<h4>Que se passe-t-il si nvidia-smi n\u2019est pas install\u00e9 sur le serveur ?<\/h4>\n<p>Si <span style=\"color:green; font-family:Pandocode;\">nvidia-smi<\/span> n\u2019est pas disponible, le plugin Pandora FMS \u00e9met le module <span style=\"color:green; font-family:Pandocode;\">GPU_Count<\/span> avec la valeur 0 en \u00e9tat critical.<br \/>\nCela <Strong>permet de g\u00e9n\u00e9rer une alerte sans interrompre l\u2019ex\u00e9cution de l\u2019agent ni produire de XML invalide<\/Strong>.<br \/>\nLe d\u00e9fi reste visible comme absence de GPU ou comme d\u00e9faillance de disponibilit\u00e9 de la source de donn\u00e9es.<\/p>\n<h4>Le GPU monitoring suffit-il pour g\u00e9rer une infrastructure d\u2019IA ?<\/h4>\n<p><Strong>Non<\/Strong>. Il fait partie d\u2019un ensemble plus vaste.<br \/>\nLe GPU est un composant critique, mais <Strong>une infrastructure d\u2019IA d\u00e9pend aussi du CPU, de la RAM, du stockage<\/Strong>, du r\u00e9seau, des services&#8230;<br \/>\nC\u2019est pourquoi le GPU monitoring doit \u00eatre int\u00e9gr\u00e9 dans une strat\u00e9gie plus large d\u2019AI infrastructure monitoring. Sans cela, il sera impossible d\u2019obtenir une vision op\u00e9rationnelle compl\u00e8te.[\/et_pb_text][et_pb_button button_url=\u00a0\u00bb@ET-DC@eyJkeW5hbWljIjp0cnVlLCJjb250ZW50IjoicG9zdF9saW5rX3VybF9wYWdlIiwic2V0dGluZ3MiOnsicG9zdF9pZCI6IjM2MjI3MCJ9fQ==@\u00a0\u00bb button_text=\u00a0\u00bb\u2190 Retour \u00e0 Th\u00e8mes IT\u00a0\u00bb button_alignment=\u00a0\u00bbleft\u00a0\u00bb _builder_version=\u00a0\u00bb4.22.0&Prime; _dynamic_attributes=\u00a0\u00bbbutton_url\u00a0\u00bb _module_preset=\u00a0\u00bbdefault\u00a0\u00bb custom_button=\u00a0\u00bbon\u00a0\u00bb button_text_size=\u00a0\u00bb1em\u00a0\u00bb button_text_color=\u00a0\u00bb#0C312F\u00a0\u00bb button_bg_color=\u00a0\u00bb#FFFFFF\u00a0\u00bb button_bg_color_gradient_direction=\u00a0\u00bb90deg\u00a0\u00bb button_bg_color_gradient_stops=\u00a0\u00bb#82B92E 0%|#3CB92E 100%\u00a0\u00bb button_bg_color_gradient_start=\u00a0\u00bb#82B92E\u00a0\u00bb button_bg_color_gradient_end=\u00a0\u00bb#3CB92E\u00a0\u00bb button_border_width=\u00a0\u00bb1px\u00a0\u00bb button_border_color=\u00a0\u00bb#eaeaea\u00a0\u00bb button_border_radius=\u00a0\u00bb100px\u00a0\u00bb button_use_icon=\u00a0\u00bboff\u00a0\u00bb z_index=\u00a0\u00bb0&Prime; custom_margin=\u00a0\u00bb60px||0px||false|false\u00a0\u00bb custom_padding=\u00a0\u00bb10px|50px|10px|50px|true|true\u00a0\u00bb custom_padding_tablet=\u00a0\u00bb\u00a0\u00bb custom_padding_phone=\u00a0\u00bb10px|20px|10px|20px|true|true\u00a0\u00bb custom_padding_last_edited=\u00a0\u00bbon|phone\u00a0\u00bb custom_css_main_element=\u00a0\u00bbright:0!important;||font-family:%22Pandora-Bold%22!important;\u00a0\u00bb global_module=\u00a0\u00bb367749&Prime; locked=\u00a0\u00bboff\u00a0\u00bb global_colors_info=\u00a0\u00bb{}\u00a0\u00bb button_bg_color__hover_enabled=\u00a0\u00bbon|desktop\u00a0\u00bb button_bg_color_gradient_start__hover=\u00a0\u00bb#eaeaea\u00a0\u00bb button_bg_color_gradient_end__hover=\u00a0\u00bb#f4f4f4&Prime; button_bg_color__hover=\u00a0\u00bb#eaeaea\u00a0\u00bb button_bg_enable_color__hover=\u00a0\u00bbon\u00a0\u00bb button_bg_use_color_gradient__hover=\u00a0\u00bbon\u00a0\u00bb button_bg_color_gradient_stops__hover=\u00a0\u00bb#eaeaea 0%|#f4f4f4 100%\u00a0\u00bb][\/et_pb_button][\/et_pb_column][\/et_pb_row][\/et_pb_section][et_pb_section fb_built=\u00a0\u00bb1&Prime; custom_padding_last_edited=\u00a0\u00bbon|desktop\u00a0\u00bb admin_label=\u00a0\u00bbFinal CTA\u00a0\u00bb _builder_version=\u00a0\u00bb4.22.0&Prime; _module_preset=\u00a0\u00bbdefault\u00a0\u00bb background_color=\u00a0\u00bb#161327&Prime; use_background_color_gradient=\u00a0\u00bbon\u00a0\u00bb background_color_gradient_stops=\u00a0\u00bbrgba(22,19,39,0.5) 17%|rgba(22,19,39,0.5) 100%\u00a0\u00bb background_color_gradient_overlays_image=\u00a0\u00bbon\u00a0\u00bb background_image=\u00a0\u00bbhttps:\/\/pandorafms.com\/wp-content\/uploads\/2023\/12\/banner-contacta-it-topics.webp\u00a0\u00bb background_size=\u00a0\u00bbcustom\u00a0\u00bb background_image_width=\u00a0\u00bb121%\u00a0\u00bb background_image_height=\u00a0\u00bb192%\u00a0\u00bb background_position=\u00a0\u00bbtop_left\u00a0\u00bb z_index=\u00a0\u00bb1&Prime; max_width=\u00a0\u00bb1080px\u00a0\u00bb max_width_tablet=\u00a0\u00bb98%\u00a0\u00bb max_width_phone=\u00a0\u00bb98%\u00a0\u00bb max_width_last_edited=\u00a0\u00bbon|tablet\u00a0\u00bb module_alignment=\u00a0\u00bbcenter\u00a0\u00bb custom_margin=\u00a0\u00bb80px||80px||true|false\u00a0\u00bb custom_padding=\u00a0\u00bb40px|20px|120px|20px|false|true\u00a0\u00bb custom_padding_tablet=\u00a0\u00bb40px|0px|120px|0px|false|true\u00a0\u00bb custom_padding_phone=\u00a0\u00bb40px|0px|120px|0px|false|true\u00a0\u00bb scroll_scaling=\u00a0\u00bb40|55|85|100|100%|120%|100%\u00a0\u00bb motion_trigger_start=\u00a0\u00bbtop\u00a0\u00bb background_last_edited=\u00a0\u00bbon|phone\u00a0\u00bb background_size_tablet=\u00a0\u00bbcover\u00a0\u00bb background_size_phone=\u00a0\u00bbcover\u00a0\u00bb background_position_phone=\u00a0\u00bbtop_center\u00a0\u00bb border_radii=\u00a0\u00bboff|20px|20px|20px|20px\u00a0\u00bb border_color_all=\u00a0\u00bb#ffffff\u00a0\u00bb box_shadow_style=\u00a0\u00bbpreset1&Prime; box_shadow_vertical=\u00a0\u00bb0px\u00a0\u00bb box_shadow_blur=\u00a0\u00bb80px\u00a0\u00bb box_shadow_color=\u00a0\u00bb#506da0&Prime; global_module=\u00a0\u00bb367449&Prime; saved_tabs=\u00a0\u00bball\u00a0\u00bb global_colors_info=\u00a0\u00bb{}\u00a0\u00bb][et_pb_row use_custom_gutter=\u00a0\u00bbon\u00a0\u00bb gutter_width=\u00a0\u00bb2&Prime; make_equal=\u00a0\u00bbon\u00a0\u00bb _builder_version=\u00a0\u00bb4.22.0&Prime; _module_preset=\u00a0\u00bbdefault\u00a0\u00bb max_width=\u00a0\u00bb750px\u00a0\u00bb module_alignment=\u00a0\u00bbcenter\u00a0\u00bb custom_margin=\u00a0\u00bb0px||0px||true|false\u00a0\u00bb custom_padding=\u00a0\u00bb0px|0px|0px|0px|true|true\u00a0\u00bb global_colors_info=\u00a0\u00bb{}\u00a0\u00bb][et_pb_column type=\u00a0\u00bb4_4&Prime; _builder_version=\u00a0\u00bb4.22.0&Prime; _module_preset=\u00a0\u00bbdefault\u00a0\u00bb global_colors_info=\u00a0\u00bb{}\u00a0\u00bb][et_pb_text content_tablet=\u00a0\u00bb<\/p>\n<p class=%22h2-w%22>Habla con el equipo de ventas, pide presupuesto, o resuelve tus dudas sobre nuestras licencias<\/p>\n<p>\u00a0\u00bb content_phone=\u00a0\u00bb<\/p>\n<p class=%22h2-w%22>Habla con el equipo de ventas, resuelve tus dudas sobre nuestras licencias o pide presupuesto<\/p>\n<p>\u00a0\u00bb content_last_edited=\u00a0\u00bboff|desktop\u00a0\u00bb _builder_version=\u00a0\u00bb4.27.4&Prime; _module_preset=\u00a0\u00bbdefault\u00a0\u00bb header_2_font_size=\u00a0\u00bb2em\u00a0\u00bb text_orientation=\u00a0\u00bbcenter\u00a0\u00bb module_alignment=\u00a0\u00bbleft\u00a0\u00bb custom_margin=\u00a0\u00bb0px||20px||false|false\u00a0\u00bb custom_padding=\u00a0\u00bb0px||0px||true|false\u00a0\u00bb global_colors_info=\u00a0\u00bb{}\u00a0\u00bb]<\/p>\n<p class=\"h2-w\">Contactez notre service commercial, posez vos questions sur nos licences ou demandez un devis<\/p>\n<p>[\/et_pb_text][et_pb_code _builder_version=\u00a0\u00bb4.27.4&Prime; _module_preset=\u00a0\u00bbdefault\u00a0\u00bb width=\u00a0\u00bb220px\u00a0\u00bb module_alignment=\u00a0\u00bbcenter\u00a0\u00bb custom_margin=\u00a0\u00bb40px||0px||false|false\u00a0\u00bb custom_padding=\u00a0\u00bb0px||0px||true|false\u00a0\u00bb locked=\u00a0\u00bboff\u00a0\u00bb global_colors_info=\u00a0\u00bb{}\u00a0\u00bb]<\/p>\n<div class=\"doblebtn\"><!-- [et_pb_line_break_holder] --><a class=\"prices-2024-btn\" style=\"padding:10px 30px!important;font-family:Pandora-BoldRus;\" href=\"https:\/\/pandorafms.com\/fr\/contact\/\">Contactez-nous<\/a><\/div>\n<p>[\/et_pb_code][\/et_pb_column][\/et_pb_row][\/et_pb_section]<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Sections Qu\u2019est-ce que le GPU monitoring Pourquoi le GPU monitoring est important Environnements on-premise, hybrides et enterprise Les m\u00e9triques cl\u00e9s du GPU monitoring nvidia-smi, DCGM et plateformes de monitoring Les risques li\u00e9s \u00e0 l\u2019absence de monitoring des GPU Des m\u00e9triques isol\u00e9es \u00e0 la corr\u00e9lation op\u00e9rationnelle Comment Pandora FMS aide au GPU monitoring Seuils, alertes et [&hellip;]<\/p>\n","protected":false},"author":33,"featured_media":424582,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_et_pb_use_builder":"on","_et_pb_old_content":"","_et_gb_content_width":"","_joinchat":[],"footnotes":""},"categories":[3507,7758],"tags":[],"class_list":["post-424590","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-it-topics","category-surveillance"],"_links":{"self":[{"href":"https:\/\/pandorafms.com\/fr\/wp-json\/wp\/v2\/posts\/424590","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/pandorafms.com\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/pandorafms.com\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/pandorafms.com\/fr\/wp-json\/wp\/v2\/users\/33"}],"replies":[{"embeddable":true,"href":"https:\/\/pandorafms.com\/fr\/wp-json\/wp\/v2\/comments?post=424590"}],"version-history":[{"count":3,"href":"https:\/\/pandorafms.com\/fr\/wp-json\/wp\/v2\/posts\/424590\/revisions"}],"predecessor-version":[{"id":424597,"href":"https:\/\/pandorafms.com\/fr\/wp-json\/wp\/v2\/posts\/424590\/revisions\/424597"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/pandorafms.com\/fr\/wp-json\/wp\/v2\/media\/424582"}],"wp:attachment":[{"href":"https:\/\/pandorafms.com\/fr\/wp-json\/wp\/v2\/media?parent=424590"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/pandorafms.com\/fr\/wp-json\/wp\/v2\/categories?post=424590"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/pandorafms.com\/fr\/wp-json\/wp\/v2\/tags?post=424590"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}