资讯

苹果质疑当前基于最终准确率的评估范式,并借助确定性谜题模拟器将评估范围扩展到思维轨迹的中间解。分析表明,随着问题复杂度的增加,正确的解会系统性地出现在思维的后期,而错误的解则不然,这为理解推理模型 (LRM) 中的自我修正机制提供了定量层面的见解。
争议的火苗很快被一篇名为 《The Illusion of The Illusion of Thinking》 的反驳论文点燃,作者是一位名叫Alex Lawsen的独立研究员——以及,他的合作伙伴:大语言模型Claude Opus 4。
Google在本周二(6/17)正式发布已预览数月的Gemini 2.5 Flash与2.5 Pro稳定版,同时宣布预览入门级的Gemini 2.5 Flash-Lite。
在当前主流评测中,AM-Thinking-v1 也交出了极具冲击力的成绩单,仅 32B 的结构在数学推理(AIME 系列)和代码生成(LiveCodeBench)中分别取得了 85.3 和 70.3 的高分,不仅全面超越了 DeepSeek-R1(671B MoE 架构),还逼近甚至追平了 Qwen3-235B-A22B 和 Seed1.5-Thinking 等超大规模 MoE 模型的成绩。
谷歌于近日正式发布多模态推理模型 Gemini 2.0 Flash Thinking,这一新型 AI 模型在推理能力、处理速度和透明度方面均实现突破性进展,向 OpenAI 的 o1 ...
近日,科技界传来新动态,阿里巴巴旗下的通义千问正式揭晓了其最新研发成果——“Thinking (QwQ)”深度思考模型。这一创新模型不仅支持深度思考 ...
IT之家 4 月 14 日消息,IT之家从豆包大模型团队获悉,字节跳动最新思考模型 Seed-Thinking-v1.5 技术细节今日公开,该模型将于 4 月 17 日通过火山引擎 ...