Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜
Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。
搜索
我们自建的"你画我猜 Benchmark"第一期用150个词、1350张SVG画作对8款模型进行互画互猜测试,最终GPT-6 Astra以75.5分险胜Gemini 3.8 Flash与Claude Fable 5.1,结果显示思考更多或花费更多的模型并未稳定取得更高分,且部分模型连自己的画都认不出。
北京航空航天大学史振威与邹征夏教授团队开发了面向广域地球观测的生成式基础模型MetaEarth3D,只需给定文字或卫星图即可生成无界连续一致的三维世界场景,并自带空间标注使空天AI模型空间理解能力平均提升22.85%。
OpenClaw 2.0(v2026.8.1)对比前代v2026.7.1-2的实测显示,新版将LLM请求次数减少38%、工具调用减少35%且未触发上下文压缩,把开源Agent从个人工具推向可长期托管、可协作复盘的工作系统,但命令行安装和工程门槛依然较高,更适合团队受控环境测试。
Physical Superintelligence(PSI)完成5800万美元(约3.9亿元人民币)种子轮融资,由比尔盖茨牵头的Breakthrough Energy Ventures领投,旨在打造由AI"虚拟物理学家"组成的物理实验室,核心产品Emmy已落地数据中心优化等场景。
微软开始倒查员工AI账单,有员工28天内烧掉2.8万美元(约19万元人民币)token,公司因此推行部门预算、个人支出仪表盘等管控措施,并将默认模型切换为OpenAI的GPT-5.6 Sol。
Meta联合南洋理工大学等多所高校全开源HumanCLAW基准,将高层行动决策与低层运动控制分离以单独测量视觉语言模型的行动智能,九个前沿模型完整交互成功率仅16.8%,揭示出当前基础模型缺乏持续维护自身身体状态估计的具身自我感知缺口。
OpenAI 的 GPT-6 Astra 在有界素数间隔问题上将上界从 246 推进至 186,并完成 Lean 形式化验证,显示 AI 正从数学解题工具走向研究伙伴。
Talespark由成镭与Rolan共同创办,已完成XVC领投的数千万元天使轮,其核心系统World Director作为AI Agent重新组织游戏核心逻辑,使世界能根据玩家经历持续回应,首款PC端RPG《Project S》计划2028年年初上线Steam。
沙特人工智能公司HUMAIN基于中国MiniMax的开源旗舰模型MiniMax M3推出阿拉伯语大模型HUMAIN M3,使用超过1万亿Token阿拉伯语数据进行后训练,在七项阿拉伯语基准测试中等权平均分达89.37%,标志着中国开源模型正成为全球AI生态的底层技术基础。
EvoMap团队提出了一套不更新基模参数的RSI工程解法:由EvoX智能体、Evolver进化引擎和EvoMap经验流转网络构成的自进化体系,将Agent执行轨迹蒸馏为结构化控制对象Gene,通过GEP协议在35.7万智能体间流转481万项经验资产,使其在多款主流大模型上将长流程任务通过率提升8.7至15.5个百分点。