终局奖励之后:从Apodex 1.1看长程 Agentic RL 如何分配credit
文章摘要
如果一个Agent用几十轮工具调用完成了一项任务,最后只得到一个0/1reward,这个reward应该怎样分配给前面的决策?这是长程AgenticRL中一个很核心、但也很容易被“最终成功率”掩盖的问题。
正文暂不可用。
原文链接暂不可用。
可以返回作者主页,看看其他文章。
如果一个Agent用几十轮工具调用完成了一项任务,最后只得到一个0/1reward,这个reward应该怎样分配给前面的决策?这是长程AgenticRL中一个很核心、但也很容易被“最终成功率”掩盖的问题。
正文暂不可用。
原文链接暂不可用。
可以返回作者主页,看看其他文章。