各HARNESS 操作cocos对比

基于最近做试玩广告 ,整理了一组相对简单的测试集。
然后对热门harness 进行了测试 模型 统一使用GLM 5.2 FP8
cc还是强 cursor cli拉完了

1赞

意思是opencode最好吗? 我一直在用trae IDE做cocos creator 3.8项目,简单的做了5,6个了,也都满足了。 :sweat_smile:

我自己日常用cursor. 我也很惊讶。。。。

你也用这个吗,怎么收费的
image

我用会员。。。。感觉额度还是够的。

cursor我已经用了快2年了,首先个人用的话20美金是肯定够的,其次就是cursor目前用MCP处理cocos编辑器还是太慢了,而且一旦需求复杂了就会超时,我昨晚跑一个MCP任务跑了30分钟,直接给我挂起了,最后还是得自己来,不过没办法,我不想折腾cc了,cursor目前还是国区最友善得AI工具了,我感觉比codex还要友善,codex偶尔也锁ip,慢的要死

你用的啥mcp啊? 我是让cursor自己写的mcp… 基本上cocos可以实现完全不操作 ide了

可以跑一下zcode看看吗,我感觉挺好用的,能自己开网页自动模拟操作游戏去做测试

我2.x和3.x用的MCP不一样,昨晚跑的是2.x的,是论坛开源那个,不过我感觉不是MCP的问题

我试试 正在增加测试 evox 和deepseeek harness

评测的是试玩场景,不是完整游戏开发场景是吧?

微小的试玩吗

是的 都是一些简单IDE操作。

不过之前的数据可能不太准 正在重跑

要不要让pink加入斗蛐蛐?

PinK 目前没有现成的cli接口,不好接入进去。 用COCOS cli 就行。

后面可能会单独开PinK cli ,到时候一起斗蛐蛐 :sweat_smile:

1赞

测试集能开源一下吗,我也来试试自己的harness

好像还真行 基于我自己的开源了一半的工程 我整理一下。
@weibo 这事儿有没有可能官方出面拉个库, 大家贡献一下case 从经验来看agent发展 离不开好的benchmark

是的,统一一个测试集才能对比,发现问题才能不断改进进步。测试集最好能有不同难度层次,尽量覆盖更多场景的题目 :joy:

我琢磨一下这个事怎么弄比较好落地