◌ Story View

从单篇内容进入更完整的理解路径

当前页面围绕正文阅读、上下篇跳转、推荐阅读与侧边扩展内容展开,让读者不只停留在单篇浏览,而能自然进入连续性的主题阅读之中。

Read Track Share Next

如何选择Agent Harness?南洋理工大学新研究提供指导

在开发Agent应用时,选择合适的Harness常常令人困惑。不同的Harness会影响工具调用、上下文管理和错误恢复,导致模型的实际表现存在显著差异。有些Harness在特定任务上表现优异,但在其他任务中未必合适。因此,怎样针对不同任务选择合适的Harness?是否存在一种通用的解决方案能够适配多种任务?来自新加坡南洋理工大学的安波教授团队在其研究报告《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》中深入探讨了这些问题。

该报告不仅仅是对Harness的简单排行,而是将模型与Harness看作一个整体进行比较。研究使用了四种可配置的Harness:OpenHands、DSH、PI和openJiuwen,并将其与Codex–GPT和Claude Code–Claude这两组原生搭配进行了对照。研究得出一个重要的结论:Harness的表现并非固定,具体效果取决于它与模型和任务的结合。与其寻求一种普适的Harness,更应关注特定任务,以便对模型与Harness进行联合评估。

为了评估Harness对Agent表现的影响,研究选择了四种可配置的Harness,并对接入多个型号的模型进行实验。这种交叉设计不仅能展示同一模型在不同Harness下的表现变化,还能比较相同Harness在不同模型和任务下的稳定性。此外,实验涉及三个不同任务集:TUA-Bench、ALE-CLI和Terminal-Bench 4,并根据任务集的构成与评分标准分别进行了对比分析,最终形成包含66项结果的比较矩阵。 乐玩国际官网

在实验配置和数据方面,使用的Harness均通过OpenRouter来调用模型,并保持其他设置的默认值。为确保不同组合的计分方式统一,研究对任务集采用了固定的分母,使得比较结果更具可比性。在整个实验中,涉及四种可配置Harness及两个原生Harness,涵盖多个模型与不同任务集,为Harness选择提供了系统的依据。

觉得有用?分享给朋友

让更多人看到这篇内容,也方便朋友继续延展阅读相关主题。

微博 QQ 微信

推荐阅读