STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation
能够理解、推理和生成交错文本-图像序列的统一多模态模型在结构上仍然分散:现有方法要么通过离散标记化牺牲视觉保真度,要么通过组合不同的模态施加结构不对称性。
Modality-specific neurovascular coupling via layer-segregated arteriole networks | Science
大脑的血管系统通过神经血管耦合动态调节能量供应。在这项研究中,我们表明,在小鼠中,神经血管耦合是模态依赖性的:不同的感觉输入招募特定的小动脉类型,产生......
IEEE Transactions on Neural Networks and Learning Systems, Volume 37, Issue 9, September 2026
1) 多模态持续学习的最新进展:综合调查作者:D. Yu、X. Zhang、Y. Chen、A. Liu、Y. Zhang、P. S. Yu、I. King 页数:4014 - 40342) Rethinking the Utilization of individual rewards in Multiagent Reinforcement Learning With Sparse Team Rewards作者:Y. Zhang、Y. Xu、C. Zhang、 C. Wang, Z. Yang, B. Tang, E. Chung 页数:4035 - 40493) 通过掩蔽和对比原型的不完整
Resnet 驱动的瓦山东方蜘蛛毒液腺转录组先导肽的计算机识别结合分子对接和动力学模拟摘要背景: 瓦山东方蜘蛛是一种具有相当生态和科学重要性的毒蜘蛛。其毒液成分复杂且易于采集,是发现天然肽类药物的宝贵资源。传统的湿实验室筛选方法受到实验条件严格、资源消耗高、研究周期长的限制,阻碍了对该蜘蛛毒腺转录组功能肽的高效鉴定。方法:为了解决这些技术瓶颈,本研究开发了一种名为 PepPI-DRN 的新型深度学习模型,用于肽-蛋白质相互作用预测。该模型利用肽和蛋白质的序列和结构特征,集成了残差等变图神经网络、残差一维卷积神经网络和双模态注意力机制。结果:独立测试集的结果表明,与最先进的方法相比,PepPI-
Luce: Relightable Gaussians for 3D Asset Generation
高保真图像到3D生成需要一种能够同时捕捉几何形状和外观的3D表示。为了支持重新照明和集成到标准渲染管道中,该表示应包括基于物理的渲染(PBR)模态。
The Design System as the Control Plane for AI-Generated UI
AI辅助开发使快速生成前端代码变得更加容易。开发者可以要求一个表单、仪表板小部件、设置页面或模态流程,并在几秒内获得可工作的初稿。这种速度很有用,尤其是当团队快速推进时……
Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
多模态大语言模型越来越多地使用视觉思维链 (Visual CoT) 来推理空间、时间和具体环境。通过生成中间推理图像,Visual CoT 为视觉预见提供了直观的机制,但引入了大量的推理开销,这对于主动视频推理来说尤其成问题。我们询问模型是否可以在训练过程中学会视觉思考,同时在推理时直接进行推理。我们引入内部化视觉思维(IVT),这是一种联合优化文本预测和……的训练后框架。
NVIDIA opens Alpamayo 2 Super for commercial use
NVIDIA 刚刚免费提供了最强大的自动驾驶 AI,供任何人使用。 Alpamayo 2 Super 将多模态感知、推理、轨迹规划和动作生成结合在一个模型中,同时还生成可用于训练和评估其他自动驾驶系统的数据。
IEEE Transactions on Cognitive and Developmental Systems, Volume 18, Issue 4, August 2026
1) 基于混合预测网络的有限感知多智能体侦察博弈作者:X. Shen,B. Hu,Z. -H。关, D. 张, T. Li 页数: 858 - 8722) 黎曼流形上的脑电网络连通性的低维矩阵判别分析用于情感识别作者: H. Fang, M. Wang, Z. 张, Y. Wang, Y. Yang 页数: 873 - 8873) 学习表达性任务嵌入和上下文转换的样本高效探索Reduction in Offline Meta-Reinforcement Environment作者:H. Wang, X. Tan, T. Yao, Z. Fang, P. Qi, X. QiuPages: 888
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
偏好对齐已成为提高大型语言模型 (LLM) 性能的关键组成部分,但其对多模态大型语言模型 (MLLM) 的影响仍相对未得到充分研究。与语言模型类似,用于图像理解任务的 MLLM 也会遇到幻觉等挑战。在 MLLM 中,幻觉不仅可以通过陈述不正确的事实而发生,还可以通过产生与图像内容不一致的响应而发生。 MLLM 对齐的主要目标是鼓励这些模型将响应与图像信息更紧密地对齐。最近...
Complex and Intelligent Systems, Volume 12, Issue 8, August 2026
1) 病理图像诊断的多尺度分类框架作者:蒋培和,徐玉琨,陆宁2) 多标准决策中循环直觉模糊集的改进排序和聚合算子作者:Dian Pratama, Binyamin Yusoff, Faishal Al-Sharqi3) 室内定位的非视距识别和误差缓解算法:综述作者:Suying Jiang,Ruibiao张,辉高4)RSGM:区域语义引导的多模态图像匹配方案作者:Fangwei Jin,Yun Liao,Qing Duan5)Few-shot LoRA调整用于具有语义提示匹配的流派特定音乐生成作者:Suwook Lee,Myeonghoon Jin,Yunsick Sung6)A Study