搜索引擎 + AI 驱动的行业新闻

【覆盖行业】
信保 |出口 |金融
制造 |农业 |建筑 |地产
零售 |物流 |数智

【访问入口】
hangyexinwen.com

【新闻分享】
点击发布时间即可分享

【联系我们】
xinbaoren.com
(微信内打开提交表单)

📰 张一鸣的「慢」,和整个行业的「快」-钛媒体官方网站

本文批评当前AI行业的“参数繁荣”和榜单崇拜,指出虽然模型参数、公开基准和短期热度在持续攀升,但与实际生产场景的落差在扩大。作者以字节跳动对蒸馏的谨慎态度为起点,强调蒸馏若被当作捷径,会削弱团队创新能力,导致难以解决真实行业问题。通过对比历史中的团购战争和手机参数大战,指出真正推动繁荣的不是单纯的数字,而是将技术与真实需求深度结合,在具体场景中创造稳定、可解释、可审计的价值。文中举例苹果、月之暗面、OpenRouter、Humane AI 等案例,揭示榜单与参数的短期性和不确定性,以及在工业、金融、医疗等高风险领域对可靠性和数据壁垒的更高要求。作者呼吁行业回归对真实场景的深耕,强调在生产流程中的嵌入式应用和长期、可验证的商业模式才是AI真正持续繁荣的基石。未来的AI竞争将从“谁更大/更快”转向“谁能真正落地、解决痛点、持续改进”。

🏷️ #AI #蒸馏 #生产落地 #参数崇拜 #场景化应用

🔗 原文链接

📰 复旦团队发布Hallo-Live:实时音视频数字人延迟低至0.94秒,推理速度提升16倍

本文介绍 Hallo-Live 的实时文本驱动音视频数字人生成方法。研究团队将视频和语音的生成问题转化为流式双流扩散模型,并通过异步双流 DiT 与人类偏好蒸馏实现端到端的实时交互。为解决实时性与质量的矛盾,提出未来扩展注意力,使视频流在当前块的基础上可访问少量未来音频信息,从而提升嘴型同步与发音协同。另一个创新是将“偏好”直接蒸馏进学生模型:通过 VideoAlign、SyncNet、AudioBox 三类奖励,对蒸馏目标进行加权,形成奖励导向的蒸馏,与传统模仿教师分布不同。实验在两张 NVIDIA H200 上实现约 20.38 FPS、0.94 秒端到端延迟,质量接近离线重型模型,但具备显著速度优势。 Hallo-Live 的核心在于在保持流式因果生成的前提下,完成视频和音频的联合生成,并为数字人直播、虚拟主持等场景提供可部署的阶段性解决方案。未来仍需在低成本硬件上的优化与进一步提升同步性与语音自然度。



🏷️ #实时音视频 #数字人 #唇形同步 #蒸馏学习 #未来扩展注意力

🔗 原文链接
 
 
Back to Top