Tag

AI Agent

共 60 篇文章

2026,进入 Agent RL 时代!

2026,进入 Agent RL 时代!

序章:三条哲学 在探讨技术之前,我们需要先确立三条基石性的认知: 人类的本质:人类在生物界的独特性在于高等智慧,而人与动物的分野,在于制造与使用工具的能力。 大模型的定位:ChatGPT 标志着人类首次赋予机器高等智慧。大模型之于现代人类,如同智慧之于原始人类,不仅不可或缺,更不可退化。 Agent
wangguo
0
0
2712
本地千问就能跑!具身 Agent 只纠错就够了:Spotter 用并行结构让 VLM 只在出错时出手,又快又准

本地千问就能跑!具身 Agent 只纠错就够了:Spotter 用并行结构让 VLM 只在出错时出手,又快又准

简介 具身模型(VLA)失手后很难自己改错,而让 VLM 每一步都当指挥又太慢。Spotter 反过来:具身模型一直执行,本地 Qwen 并行盯着,确认出错时才由 VLM 出手修复并反思,修完交还控制。同样步数下成功率更高,成功的回合只多十几秒,本地一个千问就能跑。 论文:Spotter: Let
wangguo
0
0
0
语音 Agent 如何获得连续记忆?颜水成团队发布 VoiceMem!打造首个面向实时语音“流式双脑”记忆底座

语音 Agent 如何获得连续记忆?颜水成团队发布 VoiceMem!打造首个面向实时语音“流式双脑”记忆底座

当AI成为与人长期共生的AGI Being时,默契也将成为人机关系的一部分。 所谓默契,就是你不用反复交代过去,它也知道你为什么此刻提起此事;你的想法改变了,它也能及时跟上。 这种默契需要记忆。即使你没有重新提起过去的经历、偏好和感受,它也能听懂你此刻的话。 但在实时语音里,留给AI寻找这些的时间非
wangguo
0
0
89
直播预告!如何在真实  Coding Agent Harness 中接入 RL?

直播预告!如何在真实 Coding Agent Harness 中接入 RL?

随着编码智能体从“模型能力”走向“模型 + Harness”协同,工具调用、上下文管理与控制流正在成为影响智能体能力的重要因素。 然而,将真实 Agent Harness 接入强化学习训练并不简单:环境故障与奖励投机会污染训练信号,训练与推理环境的差异也可能导致策略更新偏离真实 Agent 行为。
wangguo
0
0
111
Harness基模JIT-27B,为每个任务写一套“Claude Code”

Harness基模JIT-27B,为每个任务写一套“Claude Code”

Harness基模JIT-27B,为每个任务写一套“Claude Code” Agent benchmark 通常把模型视为能力的主要来源,但同一模型只要更换记忆组织、规划协议、工具暴露方式或错误恢复流程,最终表现就可能跨越一个明显的档位。 这样的差异来自 Agent Harness:它定义模型在什
wangguo
0
0
164
 Multi-Agent 的新趋势:从 Agent Team 到 Agent Swarm

Multi-Agent 的新趋势:从 Agent Team 到 Agent Swarm

作者:周星星 https://zhuanlan.zhihu.com/p/2069524382196691517 前言 当我们能同时调动上百个agent时,会诞生什么新的产品形态。 这是一篇没有明确中心思想的文章,想围绕多 Agent,聊几个最近不断冒出来的产品问题。 标题里 agent team 和
wangguo
0
0
319
当 Agent 失败时,别急着怪模型:HarnessFix 如何从失败轨迹中修复 Harness

当 Agent 失败时,别急着怪模型:HarnessFix 如何从失败轨迹中修复 Harness

作者:陈孟卓,中科院软件所 PhD 一次工具调用返回了 success,任务就真的完成了吗? 未必。 在一个应用自动化任务中,Agent 连续发起了 3 次付款请求。接口表面上返回“执行成功”,但由于请求缺少必填字段,预期的付款记录一条也没有生成。 更糟的是,错误被中间层吞掉,任务完成条件又只检查了
wangguo
0
0
128
ICML 2026|让 Agent 真正协同作战:GoS 为多智能体推理构建共享信念状态

ICML 2026|让 Agent 真正协同作战:GoS 为多智能体推理构建共享信念状态

罗宇,南开大学博士生 近年来,大语言模型在数学、代码等任务上的表现不断刷新上限,但到了医疗诊断、故障排查这类真实世界任务里,真正困难的是让多个智能体在不确定的动态环境中持续协作推理。 以医疗诊断为例,主治医生不可能一开始就让病人把所有检查都做一遍,而是要根据当前诊断方向,动态安排影像科、检验科等不同
青稞
0
0
100
从 GLM/Qwen 看: Agentic RL 最新进展

从 GLM/Qwen 看: Agentic RL 最新进展

作者:YiFan-Zhang https://zhuanlan.zhihu.com/p/2054605815588435332 GLM 5.2: From Grpo to PPO 引入了 slime 这套训练与推理基础设施,同时在长链路任务里改用了更适合 compaction 的 PPO 训练方式,
青稞
0
0
601
深入理解 Agentic RL 中的行为崩塌现象

深入理解 Agentic RL 中的行为崩塌现象

作者:Jason 原文:https://zhuanlan.zhihu.com/p/2050794185909876253 过去一段时间里,我一直在思考一个问题:Agentic RL 到底和传统 RLVR 有什么本质区别? 最容易想到的答案当然是工具调用。传统 RLVR 往往围绕单轮回答展开,模型生成
青稞
0
0
252
Claude Code 源码深度解析:运行机制与 Memory 模块详解

Claude Code 源码深度解析:运行机制与 Memory 模块详解

本文档基于 Claude Code CLI 工具的源码进行深度分析,旨在用清晰易懂但专业的语言,详细讲解其内部运行机制。特别关注 Memory(记忆)模块的设计与实现。 1. 项目总览:Claude Code 是什么 Claude Code 是 Anthropic 官方开发的命令行 AI 编程助手(
wangguo
0
0
1001
当记忆从“历史”变成“经验”!UIUC、清华、微软研究院最新提出 PlugMem,让 Agent 告别流水账式记忆

当记忆从“历史”变成“经验”!UIUC、清华、微软研究院最新提出 PlugMem,让 Agent 告别流水账式记忆

当AI Agent开始从“工具调用者”走向“长期协同者”,记忆便成了决定其天花板的关键。然而,现有的记忆方案正面临一个尴尬的悖论:Agent 往往拥有一本厚厚的“交互日记”,却缺乏一套真正的“知识储备”。 近日,由UIUC、清华与微软研究院 联合提出的PlugMem引起了广泛关注。作为一个任务无关的
青稞
0
0
233
 ICLR 2026!腾讯混元联合 KCL 提出 WildToolBench,评估 Agent 对用户狂野行为的适应能力

ICLR 2026!腾讯混元联合 KCL 提出 WildToolBench,评估 Agent 对用户狂野行为的适应能力

TLDR. Agent是强大的,但用户是狂野的 😦又是一个工具使用Benchmark?不是说模型厂商追逐榜单严重,忽略用户实际体验? 确实,但我们面对这个质疑提出了WildToolBench:当我们衡量模型的工具调用能力时,不能仅仅看在完美的提问下,完美的实验环境下,LLM能否操纵工具回答正确,因
青稞
0
0
178
Agentic RL:解耦 Reasoning 与 Tool-use

Agentic RL:解耦 Reasoning 与 Tool-use

作者:sheriyuo https://zhuanlan.zhihu.com/p/2009946011120971848 近年来,随着 Agentic RL 的兴起,LLM 逐渐从“单次问答器”转变为能够在推理(Reasoning)与外部工具调用(Tool-use)之间反复交互(multi-turn
wangguo
0
0
483
BOAD:引入多臂老虎机,自动化搜索层级结构的多 Agent 架构设计

BOAD:引入多臂老虎机,自动化搜索层级结构的多 Agent 架构设计

大型语言模型(LLM)展现出强大的推理与编程能力,但在真实世界的软件工程(SWE)任务上仍难以泛化。这类问题往往涉及长时序决策,并且具有明显的 Out of Distribution问题。 现有系统通常依赖单一智能体处理 SWE 任务。它需要在一条推理链中同时进行需求理解、浏览大型代码库以及实现修复
wangguo
0
0
161
通往 AGI 的必经之路:Agent 自进化到底是在“进化”什么?

通往 AGI 的必经之路:Agent 自进化到底是在“进化”什么?

本文为 AI AMA 栏目第一期 Agent自进化 主题全观点转录。 青稞 AMA(AI AMA)是由魔搭社区、青稞社区、机智流与知乎联合发起的 AI 前沿技术圆桌对话栏目。围绕真正值得讨论的AI技术方向,以「多元视角」邀请一线实践者同框深度对谈:拆解原理、还原细节、碰撞观点,直面工程落地的真实挑战
wangguo
0
0
546
从零开始构建自进化智能体的心路历程

从零开始构建自进化智能体的心路历程

TL;DR 我们提出了 Yunjue Agent,一个面向开放域任务的原地自进化智能体系统。与当前主流的”在新环境生成数据再训练”范式不同,我们认为真正的自进化应该是 In-Situ(原位自进化)——在推理过程中持续积累工具能力,无需外部监督。 在HLE,DeepSearchQA等五个 benchm
青稞
0
0
455
Agent如何“在经验中成长”:关于自进化的关键问题与技术路径对谈

Agent如何“在经验中成长”:关于自进化的关键问题与技术路径对谈

回顾刚过去的2025年,AI领域最引人注目的范式转移正在悄然发生。 如果说大语言模型的"顿悟时刻"是让机器学会了思考,那么Agent自进化的"镜像时刻",则让AI第一次拥有了"从经验中成长"的能力。 它不再是静态的工具,而是一个能够与环境持续交互、从失败中学习、在任务中迭代策略的数字生命体。 这不是
wangguo
0
0
1137
小米大模型 Plus 团队提出BTL-UI:基于直觉-思考-关联的GUI Agent推理

小米大模型 Plus 团队提出BTL-UI:基于直觉-思考-关联的GUI Agent推理

本文作者来自小米大模型 Plus 团队,共同一作为张少杰、张若嶒、付培,通讯作者为多模态感知方向负责人罗振波。 在打造智能数字助手的过程中,让智能体像人类一样自然地理解并操作图形界面是一项核心难题。尽管多模态大模型与强化学习微调推动了智能体的进步,但其交互逻辑与真实的人机交互仍存在明显差距。 为缩小
wangguo
0
0
309
纯干货!工业场景下,LLM Agent RL的一些实践感悟

纯干货!工业场景下,LLM Agent RL的一些实践感悟

最近几个月在各种场景上做了大量的agent RL训练,例如search agent, 数据分析agent 等等。既有小的dense model,也有大的moe。有单一数据场景,有多源合板数据场景。有失败的经历,也有成功的经历。这里抽空分享下一些感悟,比较乱,随便看看就行: 1、稳定性是工业级场景下R
wangguo
0
0
346
OpenCUA:用于构建 Computer-Use Agent 的开源框架

OpenCUA:用于构建 Computer-Use Agent 的开源框架

来帮社区的同学“还愿”了!!! OpenCUA 是港大联合月之暗面提出的一个全面的开源框架,旨在扩展CUA的数据和基础模型,使用户可以高效、低门槛开发自主操作电脑的Agent。 论文:OpenCUA: Open Foundations for Computer-Use Agents 链接:https
青稞
0
0
435
MemGen:生成式隐式记忆,Agent Memory 的第三种可能

MemGen:生成式隐式记忆,Agent Memory 的第三种可能

更多解读请阅读:最新成果!Agent记忆的第三种可能:生成式隐式记忆 10月16日(周四)晚8点,青稞Talk 第81期,新加坡国立大学博士生张桂彬,将直播分享最新成果《MemGen:生成式隐式记忆,Agent Memory 的第三种可能》。 分享嘉宾 张桂彬是新加坡国立大学计算学院博士研究生,导师
青稞
0
0
441
“知人者智”:以用户为中心的智能体交互与训练

“知人者智”:以用户为中心的智能体交互与训练

10月18日(周六)上午10点,青稞Talk 第79期,伊利诺伊大学香槟分校 (UIUC) 博士生钱成,将直播分享《“知人者智”:以用户为中心的智能体交互与训练》。 分享嘉宾 钱成,伊利诺伊大学香槟分校 (UIUC) 二年级博士生,导师为季姮教授。本科就读于清华大学计算机系,导师为刘知远教授。目前工
青稞
0
0
200
Theory of Agent: From Definition, to Behavior and Objective

Theory of Agent: From Definition, to Behavior and Objective

9月9日(周二)晚8点,青稞Talk 第77期,香港中文大学王鸿儒博士,将直播分享《Theory of Agent: From Definition, to Behavior and Objective》。 分享嘉宾 王鸿儒博士于香港中文大学获得博士学位,导师为黄锦辉教授(ACL Fellow),研
青稞
0
0
329
GUI-Reflection:让多模态 GUI 智能体获得反思纠错能力的训练框架

GUI-Reflection:让多模态 GUI 智能体获得反思纠错能力的训练框架

GUI-Reflection,是一个开源的,让端到端多模态GUI模型学会自我反思和纠错的自动化框架。GUI-Reflection在智能体的各个训练阶段引入 “反思与纠错”机制,这一机制贯穿预训练、监督微调和在线训练全过程,模拟了人类“犯错→反思→重试”的认知过程,使模型在面对真实环境中的不确定性时,
青稞
0
0
248
InferCept、Preble&Cognify:面向下一代 AI Agent 工作流系统的构建

InferCept、Preble&Cognify:面向下一代 AI Agent 工作流系统的构建

主讲嘉宾 张怡颖,现任加州大学圣地亚哥分校计算机科学与工程系副教授。她的研究领域涵盖人工智能系统与数据中心云计算系统,当前主要致力于构建下一代的AI Agent系统。她曾获得OSDI最佳论文奖、SYSTOR最佳论文奖、美国国家科学基金会CAREER奖,以及来自谷歌、Meta、亚马逊、英特尔、VMwa
青稞
0
0
251
PC-Agent:面向复杂 PL 任务的多模态智能体框架

PC-Agent:面向复杂 PL 任务的多模态智能体框架

3月15日上午11点,青稞Talk 第41期,阿里通义实验室高级算法工程师张熙,将直播分享《PC-Agent:面向复杂 PL 任务的多模态智能体框架》。 分享嘉宾 张熙,博士毕业于中科院自动化研究所,目前担任阿里通义实验室高级算法工程师,负责多模态智能体Mobile-Agent等工作。在国际顶级期刊
青稞
0
0
189
OminiParser:基于纯视觉的 GUI Agent

OminiParser:基于纯视觉的 GUI Agent

11月30日上午11点,微软研究院 AI Frontiers 实验室高级研究员鲁亚东,将直播分享《OminiParser:基于纯视觉的 GUI Agent》。 主讲嘉宾 鲁亚东,微软研究院 AI Frontiers 实验室高级研究员。研究兴趣主要集中在大型视觉语言模型上,专注于构建能够在图形用户界面
青稞
0
0
181
使用CAMEL Agents构建GraphRAG及应用实践

使用CAMEL Agents构建GraphRAG及应用实践

9月26日19点,青稞Talk 第24期,Eigent AI Founding Engineer、CAMEL AI开源多智能体框架核心贡献者范文栋,将直播分享《使用 CAMEL Agents 构建 GraphRAG 及应用实践》 主讲嘉宾 范文栋,Eigent AI Founding Enginee
青稞
0
0
167
Mobile-Agent:基于多模态Agent架构的手机智能体

Mobile-Agent:基于多模态Agent架构的手机智能体

7月11日晚7点,青稞Talk第14期,阿里通义实验室高级算法专家徐海洋,将直播分享《Mobile-Agent:基于多模态Agent架构的手机智能体》。 分享嘉宾 徐海洋,阿里通义实验室高级算法专家,负责通义多模态大模型mPLUG系列工作,包括基础多模态模型mPLUG/mPLUG-2,多模态对话大模
青稞
0
0
221
ChatDev:大语言模型驱动的多智能体协作与演化

ChatDev:大语言模型驱动的多智能体协作与演化

4月15日晚7点,青稞社区组织【青稞Talk】第二期,并邀请到 ChatDev 一作、清华大学自然语言处理实验室(THUNLP)博士后钱忱参与,分享《ChatDev:大语言模型驱动的多智能体协作与演化》。本次 Talk 会基于 ChatDev 的关键思路,围绕大语言模型智能体的构建、协同、进化等方面
青稞
0
0
265
正在直播 B 站