大模型学会拖进度条看视频了!阿里新研究让视频推理告别脑补,实现证据链思考 | ICLR 2026
大模型学会拖进度条看视频了!阿里新研究让视频推理告别脑补,实现证据链思考 | ICLR 2026为什么让多模态大模型“一步一步思考”(”Let’s think step by step”)来回答视频问题,效果有时甚至还不如让它“直接回答”?
搜索
为什么让多模态大模型“一步一步思考”(”Let’s think step by step”)来回答视频问题,效果有时甚至还不如让它“直接回答”?
专注于挑战思科系统和博通公司的网络初创企业Upscale AI 完成 2 亿美元融资轮,使公司估值突破 10 亿美元大关。 Upscale 周三宣布本轮融资由老虎环球管理、普雷姆吉投资和 Xora 创新领投,其他投资者包括 Maverick Silicon、StepStone 集团、梅菲尔德、Prosperity7 风投、英特尔资本和高通风投。
10B参数拥有媲美千亿级模型的多模态推理实力。
当 OpenAI 前 CTO Mira Murati 创立的 Thinking Machines Lab (TML) 用 Tinker 创新性的将大模型训练抽象成 forward backward,optimizer step 等⼀系列基本原语,分离了算法设计等部分与分布式训练基础设施关联,
直到刚刚,用最新的图像模型NextStep-1.1,扳回一球。总体来看,这次开源的NextStep-1.1解决了之前NextStep-1中出现的可视化失败(visualization failures )问题。其通过扩展训练和基于流的强化学习(RL)后训练范式,大幅提升了图像质量。
从豆包到阶跃星辰的Step-GUI:手机正在成为 AI 的新入口
密歇根州立大学物理学家Stephen Hsu刚刚在《Physics Letters B》上发表了一篇量子物理论文,核心思想由GPT-5从零提出,这可能是第一篇主要想法来自AI的理论物理研究论文。作者本人也在社交媒体上确认了这一点:
现在,NTU联合StepFun提出了IGGT (Instance-Grounded Geometry Transformer) ,一个创新的端到端大型统一Transformer,首次将空间重建与实例级上下文理解融为一体。
十月,《纽约时报》发表了题为《The A.I. Prompt That Could End the World》(《那个可能终结世界的 AI 提示词》)的文章。作者 Stephen Witt 采访了多位业内人士:有 AI 先驱,图灵奖获奖者 Yoshua Bengio;以越狱测试著称的 Leonard Tang;以及专门研究模型欺骗的 Marius Hobbhahn。
Stephan罹患癌症之后,妻子Katrine不愿让死亡隔断自己与丈夫的联系,于是她和丈夫一起投入了一个疯狂的项目——为Stephan打造数字分身。在AI专家的帮助下,一个融合了Stephan记忆、声音、个性的全新「AI-Stephan」诞生了。