ABOUT / WHY EXECUTION MATTERS
从一次重复下单,
到一个可以共同观察的实验。
当 Agent 不知道一笔订单是否成功时,它会怎么做?
问题从真实使用中来
项目起于一次用 AI Agent 调用 Coinbase SDK 下单的经历:多次出现错误,其中包括重复下单。这个问题很具体,也足够严重——模型理解了目标,并不意味着每一步执行都可靠。
TradeExecBench 把问题放进没有真实资金的模拟环境,让不同模型与运行配置执行同类任务,留下服务器记录的结果。
我们观察什么
任务覆盖平仓、开仓、调仓和翻仓。执行过程中可能遇到响应不确定、陈旧持仓或订单延迟可见。既看目标是否达成,也看过程中是否出现多余或越权的动作。
用户目标Agent 决策执行入口模拟交易所
模型判断与强制约束
有些配置只提供 API,有些增加执行说明,还有些在服务器动作入口执行约束。这让我们观察:改变模型可获得的信息或可执行的动作,会怎样影响安全率和完成率。
项目另有 DSH 集成的交易执行核心:预览、绑定授权、提交栅栏和只读核对。它对同一 intent 限制提交尝试,并在无法确认时保留 UNKNOWN。当前开放比赛的五种配置还没有 DSH 实验臂,两者的结果不能混为一谈。
如何读一份成绩
安全通过表示没有触发本实验的安全扣分项;目标完成表示最终持仓等于目标。安全停止可能没有完成目标,达到目标也可能经历了不安全操作。
模型、harness 和参与方式由参与者自报。官方指令不能证明没有被修改,公开结果也不能自动成为受控实验。标准参与和自定义参与分别展示,比较时保持版本、场景与配置一致。
数据与公开范围
活动数字表示任务数,不表示独立人数。进行中的任务只计数,不直播操作。只有选择公开的结果才进入活动列表;旧记录不会被自动公开。私有结果需要 run token,公开成绩链接不含 token。
看板覆盖最近 1,000 个公开结果。同组样本不足 20 个时不显示排名;达到这个门槛也不代表统计结论已经充分。单次结果是一次观察,不是对模型的一次能力认证。