【赛博斗蛐蛐】同样的模型,Game Agent 与 PinK 的差别在哪里?

【赛博斗蛐蛐】同样的模型,Game Agent 与 PinK 的差别在哪里?

最近用 Game Agent 和 PinK 做了一次游戏开发对比。两边都选择了 GPT-5.6 Sol,推理等级设为“高”,依次尝试 Hello World、贪吃蛇和使用现成素材搭建平台跳跃关卡三项任务。

把模型配置统一后,这次体验里值得讨论的差异,更多地体现在交互设计、工程组织和任务执行过程上。基础功能相近的小游戏,界面和操作细节可以很不一样;已经能够游玩的工程,也可能仍处于任务未结束的状态。这些现象,让“AI 做游戏,光有强模型就够了?”有了更具体的讨论对象。

Game Agent 是 Cocos Creator 插件,PinK 则在自己的编辑器里提供游戏开发与对话操作。本次测试的版本为 Game Agent 0.3.4、PinK 0.0.1.36 Alpha,Creator 使用 3.8.8。

PinK 本次参测的是 Alpha 内测版,以下表现不代表最终品质。 这是一组具体任务的使用体验,没有对每个题目进行统一次数的重复测试,也没有统计 Token 成本。文中的判断只针对这次实际得到的结果。

两边界面均选择 GPT-5.6 Sol,推理等级为“高”。

在简单任务上,两款工具的差别主要体现在实现细节。 Hello World 这道题考察的是基本代码编写能力:脚本能否运行,场景能否接上,点击之后有没有有效反馈。

PinK 做出了点击计数和按钮反馈;Game Agent 在此基础上增加了欢迎语切换,每次点击会出现不同的文字。两边都完成了基本要求,Game Agent 的互动内容更丰富一些,因此这一项可以算小胜。

左侧为 Game Agent,右侧为 PinK。两边均实现了基础点击交互。

不过,这道题本身比较开放,没有详细规定界面和交互形式。额外的欢迎语体现了这次实现中的设计选择,还不足以据此判断两款工具在复杂代码编写上的能力高下。

贪吃蛇更接近一个完整的小项目,考察范围也从简单代码扩展到了游戏设计与开发。移动、食物、计分、失败和重新开始,需要共同组成一套可玩的流程。

Game Agent 的界面包含棋盘、分数、游戏状态和方向按钮等区域,信息与操作提示较多;PinK 的界面相对简洁。实际操作中,两边都能看到蛇的移动、计分和游戏结束等基本机制。按这道题的目标,我认为双方基本持平,差异主要是呈现方式和界面细节。

两款游戏的实际操作画面。Game Agent 的画面元素更多,PinK 的布局更简洁。

这一项测试还出现了一个容易被忽略的情况:PinK 的任务因异常没有完整跑完,但生成的贪吃蛇已经可以游玩。

两款工具也都具备预览和测试能力。Game Agent 执行了运行状态检查和交互操作;PinK 打开浏览器、截取画面并检查预览。这是它们在本次测试中的共同点。

Game Agent 与 PinK 的预览、交互和检查记录。

对于开发者来说,更值得继续考察的是这些测试覆盖了什么,以及检查结果能否帮助后续修改。打开游戏、取得截图,已经提供了观察运行结果的途径;要确认完整玩法和边界情况,仍然需要更具体的验证。

使用现成素材制作平台跳跃游戏,把关注点带到了工程结构。 这次提供了角色、平台、金币和敌人素材,要求制作包含二段跳、金币收集和踩敌人的竖屏关卡,主要考察素材理解与场景搭建能力。

对 Cocos 项目而言,场景和预制体是否被合理组织,直接关系到开发者接手后的修改方式。角色、平台和敌人在哪里,哪些内容可以复用,后续调整布局需要改什么,这些都是可玩效果之外值得检查的内容。

测试中,两边最初都没有打算直接搭建场景。我因此补充要求,明确让它们把场景搭出来,并按需使用预制体。

PinK 在这项任务中先后进行了两次尝试,均受到请求失败等异常阻断,最终没有得到可供演示的平台游戏。Game Agent 中途也出现过代码子任务失败,随后继续处理控制脚本。由于 PinK 没能提供相应结果,这项对比没有完成,无法据此评价双方场景搭建能力的高低。

Game Agent 已经生成的关卡可以进行简单试玩,角色能够移动、跳跃,也出现了踩中史莱姆后的加分提示。提供的角色、平台、金币和敌人素材都被用进了关卡。

Game Agent 生成的平台跳跃关卡,画面中出现了踩中史莱姆后的加分提示。

我进行了两次试玩,第一次是在开发任务尚未结束时的提前体验;后续又进行了一次试玩,并查看了场景、预制体和脚本。直到录制结束,Game Agent 的任务仍未全部结束,因此这里能确认的是工程已具备可操作的阶段性结果,完整需求和后续验收还需要继续检查。

工程中已经形成可继续查看和编辑的场景对象。

整体来看,Hello World 中 Game Agent 的交互细节略多;贪吃蛇的基本玩法双方都已实现,可以认为基本持平;平台跳跃则因异常没有完成双侧对比。

相同的模型配置,让工具调用、预览检查、工程组织和异常处理这些环节更值得被单独观察。本次样本还不足以说明哪一个环节决定了表现差异,但它们确实影响着开发者最终能拿到什么、还能接着做什么。后续如果继续评测,我更希望增加重复测试,并考察对已有项目的修改能力,让比较更接近日常开发。

完整实测视频:【赛博斗蛐蛐 游戏开发智能体强强对决】

3赞