zoukankan      html  css  js  c++  java
  • nvidia-smi GPU异常消失 程序中断

    GPU型号为NVIDIA的1080Ti,最近出现的状况的是某一个GPU突然就出问题了,如果在该GPU上有运行程序的话则程序中断,nvidia-smi显示出来的GPU则少了这一个。

    1、一开始怀疑是温度问题,温度过高导致自动关闭。

    2、最好的方法是先看一下nvidia-bug-report,管理员输入sudo nvidia-bug-report.sh

    参考:https://devtalk.nvidia.com/default/topic/522835/linux/if-you-have-a-problem-please-read-this-first/

    该命令会在本地生成一个nvidia-bug-report.log.gz,然后使用gunzip nvidia-bug-report.log.gz可解压缩得到nvidia-bug-report.log

    打开nvidia-bug-report.log,其中记录了很多gpu的运行信息,尤其是 /var/log/dmesg的信息,占据了该log文件的大部分,记录了从开机到生成report文件时GPU的所有运行情况。

    包括详细时间,用户等(由于该文件是从ubuntu复制过来打开的,编码问题导致乱码,修改一下编码方式就不会了,这里看得懂就好)

    然后就可以定位到问题了

    另外,nvidia-smi -a可以获取GPU的详细信息,也可以确定消失的GPU的id号就是0000:09:00。

    未完待续~~~~

  • 相关阅读:
    FFmpeg简单使用:解封装 ---- 基本流程
    SDL播放PCM音频数据
    JDK8时间新API-2
    RocketMq延时队列的实现原理
    Kibana复杂查询语句
    Es基础api
    Redis sscan命令
    如何实现分布式的延时队列
    客户端从broker拉取的messagequeue的样子
    RocketMq多个consumerQueue长什么样子
  • 原文地址:https://www.cnblogs.com/jisongxie/p/10405302.html
Copyright © 2011-2022 走看看