近日,全球顶级音频技术会议 ICASSP 2022 公布了论文入选名单。网易云信音频实验室论文——《一种针对实时通信的基于神经网络的啸叫检测方法》(A Neural Network-based Howling Detection Method for Real-time Communication Applications)被大会接收,并受邀于今年5月在会议上向学术和工业界做研究报告。
这是网易云信音频实验室创新成果连续两年受到世界顶级学术会议认可。
ICASSP(International Conference on Acoustics, Speech and Signal Processing)即国际声学、语音与信号处理会议,是IEEE信号处理协会主办的全球最大、最全面的音频领域顶级会议,具有权威、广泛的学界及工业界影响力,在国际上享有盛誉。
随着AI的迅速发展,深度神经网络在声音场景分类(ASC, Acoustic Scene Classification)和声音事件检测(AED, Acoustic Event Detection)任务中的应用已越来越多,并且明显优于传统的信号处理方法。网易云信音频实验室本次研究则是将AI技术应用于啸叫检测中,该论文为AI啸叫检测领域在全球范围内首个公开发表的研究成果。
当扬声器和话筒之间的声学耦合产生正反馈时,啸叫便会产生。传统的公共广播系统和助听器设备利用传统的啸叫功能检测和抑制啸叫。然而,实时通信(RTC)中的传统啸叫功能会受到非线性和不确定性的影响,如各种扬声器/麦克风响应、多种非线性音频处理、不稳定的网络传输抖动、声学路径变化和环境影响等。在啸叫检测中,使用特定时间-频率特征的信号处理方法对RTC场景是无效的。
云信音频实验室提出了一种基于卷积递归神经网络(CRNN)的方法,用于RTC应用中的啸叫检测,实现了出色的准确性和低误报率。该篇文章使用不同的移动设备收集和标记啸叫数据集用于模型训练,并选择对数梅尔谱作为输入特征,实现了 89.46% 的检测率和 0.40% 的误报率。 此外,所提出方法的模型大小仅为 121kB,并且已在实时运行的移动设备中实现。
作为行业内首批音视频 AI 实验室之一,网易云信音频实验室不断探索“AI+音频”前沿技术方向,连续取得业界权威认可。2021年,实验室在 AI 音频降噪和 AI 音乐检测的研究成果被第 50 届国际噪声控制工程会议(INTER-NOISE 2021)收录,自建的国内行业中首个 AI 音乐检测模型受到了高度关注。本次AI啸叫检测成果被 ICASSP 2022接收,再次证明了网易云信在音频技术领域的顶尖研究实力。
未来,网易云信音频实验室将持续引领新技术发展方向,并将先进的算法模型应用于产品和场景中,为全球用户打造极致听觉体验。
好文章,需要你的鼓励
英特尔CEO陈立武警告,除非有"重要外部客户"保证利润,否则可能停止14A半导体制程投资。他表示,英特尔18A前的制程可仅靠自有产品获得合理回报,但14A制程的资本成本增加,需要外部客户才能实现可接受回报。如果实施这一决定,可能意味着英特尔无法继续遵循摩尔定律,这对半导体行业将产生深远影响。
浙江大学团队开发的LAPO方法成功解决了AI推理模型"过度思考"问题,通过两阶段训练让AI学会根据问题复杂度自主调整推理深度。实验显示该方法将计算用量减少40.9%的同时准确率提升2.3%,为AI系统的智能化和实用化发展提供了重要突破。
Dispo社交网络和约会应用Teaser AI联合创始人Daniel Liss创立了钢铁制造公司Nemo Industries。该公司计划利用AI技术优化生铁生产,并自建熔炉设施。Liss认为从创立之初就使用AI的公司将比竞争对手拥有20%-30%的利润优势。公司此前已融资2820万美元,目前正与现有投资者洽谈1亿美元A轮融资,并获得两个南方州超过10亿美元的激励措施承诺。
本研究提出了首个针对视觉自回归模型的测试时缩放框架TTS-VAR,通过自适应批次管理、聚类式多样性搜索和重采样式潜力选择三大策略,将AI图像生成质量显著提升8.7%。该框架巧妙地将生成过程视为路径搜索问题,在早期保持结构多样性,后期进行智能选择,实现了计算效率与生成质量的双重优化,为视觉生成技术发展提供了新思路。