AI资讯新闻榜单内容搜索-强化学习

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 强化学习
一出手就表现惊艳!国产开源大模型又杀出一匹黑马

一出手就表现惊艳!国产开源大模型又杀出一匹黑马

一出手就表现惊艳!国产开源大模型又杀出一匹黑马

至知创新研究院开源了采用稀疏 MoE 架构的代码与复杂任务导向大模型 IQuest-Q1,该模型总参数约 320B、激活参数仅约 15B,在代码生成、终端操作、智能体任务等多项评测中表现均衡,并展示了从前端交互、游戏开发到强化学习训练调试等场景的可交付能力。

来自主题: AI资讯
9656 点击    2026-09-30 11:16
答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

答案正确,推理就可靠吗?V-Rubrics用35万条细粒度准则细化多模态强化学习奖励

南洋理工大学S-Lab、A*STAR与UIUC联合提出的V-Rubrics方法将5万视觉样本拆分为35万条细粒度准则,从视觉忠实性、推理一致性和指令遵循三维度分别参与强化学习奖励分配,使基于Qwen3-VL-8B的模型在通用与知识评测中平均得分提升至68.04。

来自主题: AI技术研报
7407 点击    2026-09-28 09:48
日榜第二!北大开源,强化学习数据策略接入更简单、对比更公平

日榜第二!北大开源,强化学习数据策略接入更简单、对比更公平

日榜第二!北大开源,强化学习数据策略接入更简单、对比更公平

这个问题正随着推理模型和 RLVR 的发展变得更加重要。随着强化学习在大模型后训练中的作用不断增强,模型练什么、怎么练,也需要更仔细地安排。为了解决数据策略接入和效果比较中的麻烦问题,北大DCAI团队联合UCAS、上海算法创新研究院、中关村学院最新发布DataFlex-RL。

来自主题: AI技术研报
8112 点击    2026-09-25 10:07
马卡龙的下注:把模型后训练,做成企业服务

马卡龙的下注:把模型后训练,做成企业服务

马卡龙的下注:把模型后训练,做成企业服务

Mind Lab(马卡龙)正式发布面向企业的模型后训练与推理平台 Mint Recursive,将其从 Macaron V1.1 训练实践中沉淀的 MinT 底层系统、自动化训练与迭代管线以托管服务形式开放给企业,支持 GLM、Qwen、DeepSeek、Kimi、MiniMax 等开源基座及监督微调、强化学习、全参数训练和 LoRA。

来自主题: AI资讯
9379 点击    2026-09-24 10:10
假如有一万张卡,RL训练该怎么扩大规模?十万张呢?

假如有一万张卡,RL训练该怎么扩大规模?十万张呢?

假如有一万张卡,RL训练该怎么扩大规模?十万张呢?

当预训练将大模型带到新的能力起点,强化学习则通过持续的探索与反馈,不断激发模型在新环境、新任务中的推理与行动能力,决定它们还能走多远。

来自主题: AI技术研报
8099 点击    2026-09-22 14:43
给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

NTU、CMU、Berkeley等高校联合推出VBVR-Pro视觉推理系统,构建300项任务与100项可验证打分器的训练评测平台,测试30余个多模态模型,并验证其打分器可直接作为强化学习奖励。

来自主题: AI技术研报
7392 点击    2026-09-20 15:08
个性化智能体强化学习框架上线,8B模型盲测第一

个性化智能体强化学习框架上线,8B模型盲测第一

个性化智能体强化学习框架上线,8B模型盲测第一

当个性化Agentic RL遇上现实用户平台场景时,一直存在一个常见难点:面对同样的query,不同用户往往偏好不同的规划策略、工具调用和最终表达。

来自主题: AI技术研报
9465 点击    2026-09-14 09:22
2000+真实场景搬进仿真!一个导航模型零样本“通吃”四种机器人本体

2000+真实场景搬进仿真!一个导航模型零样本“通吃”四种机器人本体

2000+真实场景搬进仿真!一个导航模型零样本“通吃”四种机器人本体

过去一年,具身智能的技术迭代明显加快。VLA、世界模型持续演进,强化学习重新成为机器人学习的重要技术路径,Sim2Real加速从仿真走向真机,全身控制能力也在快速突破。

来自主题: AI技术研报
8799 点击    2026-09-14 09:22
WalkingLab:AI 时代的开源实验室

WalkingLab:AI 时代的开源实验室

WalkingLab:AI 时代的开源实验室

WalkingLab 是由清华大学与香港大学团队发起的开源非营利实验室,专注真实世界 AI 与项目制学习,成立五个月已推出涵盖工程实践、强化学习和大语言模型的三门核心课程,累计获超 20,000 GitHub Star 并登上 Hacker News 首页,致力于通过真实项目连接课程、论文与工程实践,加速 AGI 到来。

来自主题: AI资讯
9718 点击    2026-09-10 21:10