Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
这项研究的重点是文本到声音视频 (T2SV) 生成,旨在生成具有文本同步音频的视频,两种模式都与文本条件一致。尽管联合音视频训练取得了进展,但仍然存在两个关键挑战:(1)文本调节是一个瓶颈——共享字幕(TV = TA)触发模态干扰,而密集的训练字幕和简洁的推理用户提示之间仍然存在差距;(2)跨模态特征交互的最佳融合机制仍不清楚。为了解决第一个挑战,我们首先提出......
Embed the world: Multimodal AI for searchable aerial imagery at scale
在这篇文章中,我们将介绍问题空间、我们在 Amazon Bedrock 和 Amazon OpenSearch Serverless 上的架构、我们在 OpenStreetMap 基础事实上构建的评估方法、比较嵌入模型、融合策略、字幕和搜索方法的四个实验,以及构建类似系统时可以应用的实用指南。您将了解哪些设计选择推动了地理空间语义搜索,包括为什么 Amazon Nova Multimodal Embeddings 在我们的评估中的两个基准查询中提供了最高的 F1 分数。这里描述的工作演变成 Vexcel Intelligence,一种可搜索的图像产品。
Advancing regulatory variant effect prediction with AlphaGenome
根据 DNA 序列预测功能基因组测量结果的深度学习模型是破译遗传调控密码的强大工具。现有方法涉及输入序列长度和预测分辨率之间的权衡,从而限制了它们的模态范围和性能1,2,3,4,5。我们推出了 AlphaGenome,这是一个统一的 DNA 序列模型,它以 1 Mb 的 DNA 序列作为输入,并通过不同的模式预测数千个功能基因组轨迹,最高可达单碱基对分辨率。这些模式包括基因表达、转录起始、染色质可及性、组蛋白修饰、转录因子结合、染色质接触图、剪接位点使用以及剪接连接坐标和强度。 AlphaGenome 在人类和小鼠基因组上进行训练,在 26 项变异效应预测评估中的 25 项中匹配或超过了最强的
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
多模态大语言模型 (MLLM) 最近在视觉理解方面表现出了强大的性能,但它们往往缺乏时间意识,特别是在以自我为中心的环境中,其中推理取决于事件的正确排序和演变。这种缺陷部分源于训练目标未能明确奖励时间推理,而是依赖于帧级空间快捷方式。为了解决这个限制,我们提出了时态全局策略优化(TGPO),这是一种具有可验证奖励的强化学习(RLVR)算法,旨在激励时态……
IEEE Transactions on Artificial Intelligence, Volume 7, Issue 6, June 2026
1) 多模态医学影像中基于人工智能的自动前列腺分割:综述作者:D. Xu, R. Jin, F. Lu, D. Li, D. Shang, L. Zhang, H. Zhou, F. Shi, W. Zhu, J. Cai, E. Gau, X. Chen, T. Peng 页数: 3034 - 30492) 网络对抗性学习的对比二元性入侵:评论作者:S. Saini、A. Chennamaneni、B. Sawyerr 页数:3050 - 30673) 神经网络正则化:方法的调查和实证分析作者:C. P. Opperman、A. S. Bosman、K. M. Malan 页数:3068 -