zoukankan      html  css  js  c++  java
  • Nvidia GPU风扇和电源显示ERR! 解决办法

    训练模型时,风扇异常响,然后输入nvidia-smi发现风扇异常如下图(网上找的图)

    nvidia论坛有人给出了解决方案,即问题的根源可能是风扇转速不足使GPU过热导致的。

    首先开启GPU的persistent mode,再设置风扇的功率,重启即可生效。其中200代表的是风扇的最大功率限制,可以将其设置为最大,这样过热的时候风扇就会自动加大功率。

    sudo nvidia-smi -pm 1
    sudo nvidia-smi -pl 200 -i 1 # 最高250,指定运行的1卡最高功率为200,从而降低发热

    手动风扇控制

    此外,还可以将GPU风扇的手动风速控制打开。方法为:

    首先,使用sudo nvidia-xconfig --enable-all-gpus命令打开所有gpu在xserver中的设置(不使用sudo可能无权限写入新配置)
    然后修改配置文件:sudo vim /etc/X11/xorg.conf,在其中的DeviceSection中加入Option "Coolbits" "4"如下图所示:

    • 如果机器上有多块gpu,在第一步命令执行后,会在这个xorg.conf中出现多个Device Section,都依次执行第三步操作。重启机器后,命令行执行nvidia-settings,会打开设置界面,在其中的会显示所有GPU的设置选项,每个GPU控制选项下面都有一个Thermal settings,进入后打开enable GPU Fan Setting即可对风扇进行手动风速调整了。
  • 相关阅读:
    Scrapy
    关于函数名称和库函数名称冲突的故事
    Hibernate的一级缓存
    spring-mvc 与 openid4java
    openid4java 使用记录[转载]
    Linux定时任务Crontab详解_定时备份
    Spring的线程池ThreadPoolTaskExecutor使用案例
    BZOJ4275 : [ONTAK2015]Badania naukowe
    BZOJ4137 : [FJOI2015]火星商店问题
    BZOJ2832 : 宅男小C
  • 原文地址:https://www.cnblogs.com/xiaoaoran/p/14904624.html
Copyright © 2011-2022 走看看