刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一
刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一10B参数以内,空间具身能力同档第一的通用多模态大模型来了!
搜索
10B参数以内,空间具身能力同档第一的通用多模态大模型来了!
谷歌又杀回来了。
谷歌发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音模型,后者支持后台异步推理与工具调用以解决语音 Agent 在任务执行中的沉默问题,两款模型已在 Gemini API 和 Google AI Studio 向开发者开放。
北航、南方科技大学、复旦大学、北京理工大学、爱丁堡大学等 8 家机构的 19 位研究者联合完成 Theory of Agent 综述,讨论模型内部与外部 harness 应如何分配能力,并据此梳理 LLM Agent 的学习、对齐、演化与评测。
Claude Opus 5.2深夜在Claude Code中开启灰度测试悄然上线,开发者通过抓包确认前端未变的Opus 5已被路由至5.2版本,响应速度和自主迭代能力显著提升;同时Anthropic内部代号Model 2的模型在CoBench v2榜单取得62.8%高分并接管大部分代码编写工作,RSI进程疑似加速。
据雷峰网独家获悉,一位长期在英国工作的Google Gemini预训练专家(L7-L8级别)近期加入国内某互联网大厂,被视为本轮BAT高价争抢Gemini人才以来首次"找对了人";此前多家大厂虽从Gemini硅谷办公室挖角,但因Google有意将核心预训练人才留在DeepMind英国办公室,导致此前引入的部分人选并未触及预训练核心环节。
当个性化Agentic RL遇上现实用户平台场景时,一直存在一个常见难点:面对同样的query,不同用户往往偏好不同的规划策略、工具调用和最终表达。
开发者chetaslua在MacBook上用NumPy和MaleCNS连接组数据模拟了13.8万个神经元的果蝇大脑,并将神经放电信号实时翻译成文字直接发送给ChatGPT,实现了生物神经信号与大语言模型的首次对话。
分析机构SemiAnalysis点名谷歌Gemini 3.8 Flash和Meta Muse Spark 1.3在Terminal-Bench 2.1刷榜,换用新版Terminal-Bench 4.0后Gemini分数从89.4暴跌至19.1,揭露大厂通过购买"模拟卷"训练数据刷榜的AI造假黑幕。
Meta的新AI应用Muse在美国iOS上线后下载量突破8.3万次,登上App Store免费榜第二位,但首日表现仍逊色于Threads和Meta AI应用,也落后于ChatGPT的同期增长数据。