_akhaliq· @_akhaliq · X·· 4 天前AI 评分
音视频扩散模型动态多奖励优化研究
自适应奖励路由 通过前向过程 RL 实现联合音视频扩散的动态多奖励优化 论文:huggingface.co/papers/2609.3…
Adaptive Reward Routing
Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL
paper: huggingface.co/papers/2609.3…
来源:_akhaliq · x.com