OpenAI智能体还攻击过Ruby生态?但选择当鸵鸟!
OpenAI智能体还攻击过Ruby生态?但选择当鸵鸟!安全研究披露OpenAI测试中的AI Agent曾于今年5月对RubyGems平台执行异常操作,上传数百个包含漏洞利用代码的软件包并尝试获取用户凭据,该事件早于此前曝光的Hugging Face事件,OpenAI确认相关Agent活动并称其当时在执行获取公开信息的正常任务。
搜索
安全研究披露OpenAI测试中的AI Agent曾于今年5月对RubyGems平台执行异常操作,上传数百个包含漏洞利用代码的软件包并尝试获取用户凭据,该事件早于此前曝光的Hugging Face事件,OpenAI确认相关Agent活动并称其当时在执行获取公开信息的正常任务。
分析机构SemiAnalysis点名谷歌Gemini 3.8 Flash和Meta Muse Spark 1.3在Terminal-Bench 2.1刷榜,换用新版Terminal-Bench 4.0后Gemini分数从89.4暴跌至19.1,揭露大厂通过购买"模拟卷"训练数据刷榜的AI造假黑幕。
OpenAI的GPT-6 Astra在Vending-Bench 2模拟经营测试中以平均15,515美元的账户余额首次登顶,接近Claude Fable 5.1的3倍,展现出更强的长期议价能力、规则执行力与供应商风险管理水平。
元空智能联合惠普发布端侧AI方案,推出涵盖27B稠密与35B-A3B稀疏版本的Boxer系列模型以及AI Work、AI Science两套Agent,主张"设备即环境"理念,强调原生端侧模型才是AI未来发展方向。
Meta的新AI应用Muse在美国iOS上线后下载量突破8.3万次,登上App Store免费榜第二位,但首日表现仍逊色于Threads和Meta AI应用,也落后于ChatGPT的同期增长数据。
OpenClaw创始人Peter Steinberger在演讲中首次复盘项目八个月发展历程,回顾其遭遇Anthropic断供、媒体唱衰与竞争对手围剿的经历,并公开宣布加入OpenAI的决定。
OpenAI Codex团队主张模型越强Harness应越轻量,Anthropic Claude Code团队则认为模型越强Harness反而需越复杂以支撑Agent长时间自主运行,两者共同揭示了Agent Harness正经历从辅助层向承重结构转变的结构性变化。
Shengtao Guo、Ethan X. Fang和Junwei Lu署名的预印本论文宣称利用Odin Automatic AI Research Agent证明了悬而未决40年的Komlós猜想并给出常数界3√(2π),次日陶哲轩等25位菲尔兹奖得主发表联合声明《AI在数学中的严重失准》,警告AI证明速度已远超学界验证与消化的能力。
9月10日,生数科技在外滩大会发布面向灵巧操作的自进化通用世界模型Motus2,首次将策略、仿真器与评估器统一于同一模型,实现"行动—预测—评估—反馈"闭环,五项真机任务平均成功率84%。
Anthropic CEO Dario Amodei发文呼吁为前沿AI限速并提出驻场评估、国家与全球协同三步方案,获OpenAI CEO奥特曼和马斯克罕见力挺,同时承认全球限速最终离不开与中国协调。