Flash模型又添一员大将:实测MiniMax M3.1
Flash模型又添一员大将:实测MiniMax M3.1MiniMax于9月27日上线Flash级别模型M3.1-Flash-Preview,本文通过试衣间项目改造、机器人视频拆解、北京夜光可视化和A股市场观测台四个实测任务,将其与DeepSeek V4.1 Flash和GLM-5.3-Flash对比,结果显示M3.1速度仅次于DeepSeek但成本最低,成为Flash赛道上DeepSeek的新对手。
搜索
MiniMax于9月27日上线Flash级别模型M3.1-Flash-Preview,本文通过试衣间项目改造、机器人视频拆解、北京夜光可视化和A股市场观测台四个实测任务,将其与DeepSeek V4.1 Flash和GLM-5.3-Flash对比,结果显示M3.1速度仅次于DeepSeek但成本最低,成为Flash赛道上DeepSeek的新对手。
Einsia AI旗下Navers Lab发布视觉编程基准PPTBench,包含500个科学流程图任务并测试10个模型36种配置,GPT-6 Astra High以77.34分居首,但64.03%的结果因流程语义错误被拒,表明视觉理解仍是当前主要瓶颈。
至知创新研究院开源320B大模型IQuest-Q1,该模型在代码生成、安全漏洞挖掘等评测中表现优异,并能自主排查训练Bug,在交通调度、仓库管理、电梯调度等真实场景中展现出强大的任务解决能力。
海马云旗下RunningHub发布自研生成式视频超分模型RH Upscale,在13组横向评测中以综合得分0.539位列第一,通过内容保真约束下的时空联合重建与五档模式设计,解决视频超分中"放大而不改内容"的难题。
Nuanced创始人Ayman Nadeem发文宣布「Plan Mode已死」,指出随着AI模型能力提升,传统计划模式在AI编程中已不再必要,而规划与执行的边界正在逐渐融合。
中国电信研究院与MemTensor等机构提出首个面向智能体记忆系统的操作级幻觉评测基准HaluMem,已被EMNLP 2026主会接收,该基准分别对记忆提取、更新和问答三个环节进行检查,并对Mem0、MemOS等六套系统实测,发现高召回率可能伴随虚假信息写入、低更新幻觉率背后存在大量遗漏、上游记忆问题最终会影响回答等核心现象。
OpenAI在第四届DevDay开发者大会上发布25项更新,包括Dots个人agent、ChatGPT Space协作空间、GPT-6.1 Sol模型、Ultrafast极速档及Codex全面上云等,涵盖模型、搭建工具与分发三大板块。
中国电信星辰通用人工智能实验室推出的轻量化文档解析模型TeleOCR(约1.2B参数)凭借形变感知学习、多边形版面分割、CGDP采样及内容—结构解耦等技术创新,在OmniDocBench v1.6、Wild-OmniDocBench、PureDocBench等多个公开榜单取得领先,并在ICDAR 2026 Sci-ImageMiner挑战赛中夺冠,目前已开源。
至知创新研究院开源了采用稀疏 MoE 架构的代码与复杂任务导向大模型 IQuest-Q1,该模型总参数约 320B、激活参数仅约 15B,在代码生成、终端操作、智能体任务等多项评测中表现均衡,并展示了从前端交互、游戏开发到强化学习训练调试等场景的可交付能力。
国产初创公司德塔智能发布双足人形机器人基础模型Delta 0,其大小脑分层架构在铺床、洗碗等长程家务任务中正面叫板Figure Helix,德塔智能由清华与UCLA背景团队创立,半年内已完成近5亿元天使++轮融资。