zoukankan      html  css  js  c++  java
  • 论文笔记:DEEP LEARNING FOR MONAURAL SPEECH SEPARATION

    论文笔记:DEEP LEARNING FOR MONAURAL SPEECH SEPARATION

    Po-Sen Huang, Minje Kim, Mark Hasegawa-Johnson, Paris Smaragdis

    introduction

    对语音信号的source separation,信源分离,在很多场合都有应用。比如把noise和speech分开可以提高ASR (automatic speech recognition)的精度。还有把歌声和音乐分开,等等。传统方法有NMF,即非负矩阵分解,和PLSI,probabilistic latent semantic indexing,它们是学习 t-f 域的表示,也就是学习非负数的重构的bases和weights。

    In this paper, we explore the use of a DNN and the use of an RNN for monaural speech separation in a supervised setting. We propose the joint optimization of the network with a soft masking function. Moreover, a discriminative training
    objective is also explored. The proposed framework is shown in Figure 1.


    这里写图片描述
    这里写图片描述

    网络结构和流程图如上。可以看出,实际上是学习的语音信号的time-frequency的mask,然后再反变换到时域。用的网络就是RNN,学mask有两种,一种是hard,一种是soft。hard也就是binary的,非此即彼,soft就是学习一个比例的图,类似于heatmap一类的东西。如下:


    这里写图片描述
    这里写图片描述

    Discriminative Training :


    这里写图片描述

    Empirically, the value γ is in the range of 0.05∼0.2 in order to achieve SIR improvements and maintain SAR and SDR.

    因为评判指标里有SIR,signal to interference ratio,所以要求另外一个约束,也就是分出来的两个要尽量远离,也就是最大化类间差。

    后面的内容涉及到对语音信号的测试和评估,略。

    2018年06月06日22:09:18

    有一个可以想念的人,就是幸福。 —— 导演,岩井俊二

  • 相关阅读:
    kafka学习-卡不卡的简单使用
    mongoDB-mongo compass使用学习-最像关系型数据库的非关系型文档型数据库
    postman使用-跑男常用功能
    jmeter数据驱动csv+批量导出数据到csv文件
    jmeter-数据库查询与调用-mysql
    arch linux mysql using
    Win10安装 oracle11g 出现INS-13001环境不满足最低要求解决方法
    oracle11g数据库安装
    安装PLSQLDeveloper
    oracle基本学习
  • 原文地址:https://www.cnblogs.com/morikokyuro/p/13256723.html
Copyright © 2011-2022 走看看