从会思考、会用工具到会被评测:读懂 ReAct、Toolformer、AgentBench 与 AgentBoard

四篇论文串起 LLM Agent 的关键问题:ReAct 让推理与行动形成闭环,Toolformer 让模型自监督学习 API 调用,AgentBench 把 agent 放进八种环境考试,AgentBoard 再用进度率和轨迹诊断回答“究竟卡在哪里”。

2026年7月19日 · 20 分钟 · 9608 字