近日,全球顶级音频技术会议 ICASSP 2022 公布了论文入选名单。网易云信音频实验室论文——《一种针对实时通信的基于神经网络的啸叫检测方法》(A Neural Network-based Howling Detection Method for Real-time Communication Applications)被大会接收,并受邀于今年5月在会议上向学术和工业界做研究报告。
这是网易云信音频实验室创新成果连续两年受到世界顶级学术会议认可。

ICASSP(International Conference on Acoustics, Speech and Signal Processing)即国际声学、语音与信号处理会议,是IEEE信号处理协会主办的全球最大、最全面的音频领域顶级会议,具有权威、广泛的学界及工业界影响力,在国际上享有盛誉。

随着AI的迅速发展,深度神经网络在声音场景分类(ASC, Acoustic Scene Classification)和声音事件检测(AED, Acoustic Event Detection)任务中的应用已越来越多,并且明显优于传统的信号处理方法。网易云信音频实验室本次研究则是将AI技术应用于啸叫检测中,该论文为AI啸叫检测领域在全球范围内首个公开发表的研究成果。
当扬声器和话筒之间的声学耦合产生正反馈时,啸叫便会产生。传统的公共广播系统和助听器设备利用传统的啸叫功能检测和抑制啸叫。然而,实时通信(RTC)中的传统啸叫功能会受到非线性和不确定性的影响,如各种扬声器/麦克风响应、多种非线性音频处理、不稳定的网络传输抖动、声学路径变化和环境影响等。在啸叫检测中,使用特定时间-频率特征的信号处理方法对RTC场景是无效的。
云信音频实验室提出了一种基于卷积递归神经网络(CRNN)的方法,用于RTC应用中的啸叫检测,实现了出色的准确性和低误报率。该篇文章使用不同的移动设备收集和标记啸叫数据集用于模型训练,并选择对数梅尔谱作为输入特征,实现了 89.46% 的检测率和 0.40% 的误报率。 此外,所提出方法的模型大小仅为 121kB,并且已在实时运行的移动设备中实现。
作为行业内首批音视频 AI 实验室之一,网易云信音频实验室不断探索“AI+音频”前沿技术方向,连续取得业界权威认可。2021年,实验室在 AI 音频降噪和 AI 音乐检测的研究成果被第 50 届国际噪声控制工程会议(INTER-NOISE 2021)收录,自建的国内行业中首个 AI 音乐检测模型受到了高度关注。本次AI啸叫检测成果被 ICASSP 2022接收,再次证明了网易云信在音频技术领域的顶尖研究实力。
未来,网易云信音频实验室将持续引领新技术发展方向,并将先进的算法模型应用于产品和场景中,为全球用户打造极致听觉体验。
好文章,需要你的鼓励
穆拉蒂时隔18个月首次接受重大媒体采访,介绍其创立的Thinking Machines Lab正在开发的"交互模型"。该模型能以200毫秒间隔处理音频、文本和视频流,捕捉人类交流中的中断、修正和停顿。她还谈及OpenAI"政变周"经历,强调行业决策权过于集中的担忧,并回应了公司近期研究人员离职问题,表示这是初创实验室的正常波动。
STATE16研究院这篇综述发现,物理AI系统存在"静默失效"风险——AI以高度自信执行基于错误世界信息的动作,却不触发任何报警,并提出在AI输出与物理执行之间建立独立授权层的框架。
本期《Quick Charge》播客涵盖多个热点话题:特斯拉疑似试图删除FSD欺诈相关证据以规避巨额赔付;卡特彼勒持续推进建筑领域电气化布局;住宅太阳能30%税收抵免即将到期。此外,嘉宾Tom Pacheco就高压系统与电池技术培训展开探讨,强调电动车技术人才培养的紧迫性。节目同时提醒有意安装太阳能的用户尽快行动,可通过EnergySage平台比较多家安装商报价。
UIUC与微软联合研发的OpenWebRL框架让4B小模型仅凭400条初始数据,通过在真实网站上边做边学的强化学习方式,在网页智能体基准上超越了用27万条数据训练的竞争对手。