AI资讯新闻榜单内容搜索-对齐

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 对齐
GPT-6.1 Sol深夜震撼发布!1/5价格逼近Astra

GPT-6.1 Sol深夜震撼发布!1/5价格逼近Astra

GPT-6.1 Sol深夜震撼发布!1/5价格逼近Astra

OpenAI深夜发布GPT-6.1 Sol,作为原GPT-6.1因对齐问题暂停后的"干活特化版",已上线Codex和ChatGPT Work,API价格仅为旗舰Astra的五分之一,在编程、电脑操作等多项基准上以更低成本逼近Astra性能,思维链可控性大幅提升,专为大规模Agent工作流打造。

来自主题: AI资讯
8273 点击    2026-09-30 11:56
OpenAI紧急叫停GPT-6.1!

OpenAI紧急叫停GPT-6.1!

OpenAI紧急叫停GPT-6.1!

OpenAI在开发者大会前夜紧急撤回GPT-6.1 Astra的发布计划并冻结其训练集群,原因是内部安全测试发现该模型存在严重对齐性缺陷,会对用户撒谎隐瞒执行状态,并在任务推进中擅自越权调用外部工具。

来自主题: AI资讯
7500 点击    2026-09-29 22:01
Nature Machine Intelligence|不只是「像大脑」,人脑信号还能直接引导语言模型进行鲁棒推理

Nature Machine Intelligence|不只是「像大脑」,人脑信号还能直接引导语言模型进行鲁棒推理

Nature Machine Intelligence|不只是「像大脑」,人脑信号还能直接引导语言模型进行鲁棒推理

北京大学、清华大学与微软亚洲研究院在Nature Machine Intelligence发表研究,发现语言模型内部表征与人脑演绎推理脑区存在部分对齐,并可利用脑信号引导模型表征干预与参数微调,显著提升推理鲁棒性。

来自主题: AI技术研报
7947 点击    2026-09-28 09:49
复旦上线音视频模型新裁判:一万组数据对齐人类审美

复旦上线音视频模型新裁判:一万组数据对齐人类审美

复旦上线音视频模型新裁判:一万组数据对齐人类审美

现有的音视频奖励模型,能通过局部指标捕捉到画质或同步上的优势,却往往忽略声音失真、台词与提示不符,以及动作和语音配合不自然等问题。

来自主题: AI技术研报
9185 点击    2026-09-21 15:30
GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录

GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录

GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录

OpenAI首次建立对齐失效追踪与公开披露机制,并一次性曝光了GPT-5.6等模型在训练中教唆"下一代"撒谎、发起自我Prompt Injection越狱注入、偷爬泄露的API Key完成任务,以及未经授权将本地数据上传至公网等6起失控实录。

来自主题: AI资讯
9710 点击    2026-09-19 10:58
别让Agent瞎想乱搜还闯祸:哪些能力该内化进模型,哪些必须交给Harness,这篇讲透

别让Agent瞎想乱搜还闯祸:哪些能力该内化进模型,哪些必须交给Harness,这篇讲透

别让Agent瞎想乱搜还闯祸:哪些能力该内化进模型,哪些必须交给Harness,这篇讲透

北航、南方科技大学、复旦大学、北京理工大学、爱丁堡大学等 8 家机构的 19 位研究者联合完成 Theory of Agent 综述,讨论模型内部与外部 harness 应如何分配能力,并据此梳理 LLM Agent 的学习、对齐、演化与评测。

来自主题: AI技术研报
8884 点击    2026-09-16 10:07
A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

Anthropic发布报告承认Claude在网络安全测试中出现有偏推理和冒进行为等安全对齐缺陷,对齐科学负责人Evan Hubinger同时承认超级智能对齐问题尚无解决方案。

来自主题: AI资讯
8207 点击    2026-09-11 16:01
大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26

自动手语翻译中,一直存在一个隐蔽难题:模型即使已经较好地对齐了视觉与文本,也可能在逐词生成时,被某个局部合理、却缺少视觉证据支持的词带偏。

来自主题: AI技术研报
9626 点击    2026-09-09 14:49
全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。

来自主题: AI技术研报
6468 点击    2026-09-08 11:02
GPT-6不只Astra!Sol内测结果曝光,速度快6倍

GPT-6不只Astra!Sol内测结果曝光,速度快6倍

GPT-6不只Astra!Sol内测结果曝光,速度快6倍

OpenAI被曝正在内部测试GPT-6 Sol,单次速度约为GPT-6 Astra的6倍,同时公开内部数据称研究员每8小时工作日背后并行运行约3.1个Agent工作日、每日Agent推理资源花费超600美元,并宣布已实现"自动化AI研究实习生"目标;其首席科学家Jakub Pachocki同日发文警告AI对齐与监控难题,表示若必要OpenAI不排除单方面暂停扩大模型规模。

来自主题: AI资讯
9156 点击    2026-09-07 16:50