解出的 35 题中,1 道假题 (ezgame)、1 道签到、1 道问卷
剩下 32 题中,2 道我帮忙配置了环境,1 道 TAS 我仅进行了测试验收,1 道 Tetris 我深度介入测试(因为环境不兼容),剩下 28 题基本全部由 Codex 全程独立完成
很可怕吗?是的,很可怕。

账单其实也很可怕,大概花了 54B tokens, $36,000

Agent 的优缺点

OpenAI 和 Anthropic 两家的 harness 我都尝试了一下,不过 Claude Code 这边经常性地把我从 Fable 5 降级到 Opus 4.8(果然还是公司的合作关系不够啊x),所以后面基本上都用的是 Codex + GPT 5.6 Sol Ultra
我自己没有准备任何的 skill 或者把自己的知识 (bias) 加到上下文里,基本上每道题都只是把附件和 README 下载下来放到一个新的目录里,之后直接告诉 agent “go solve this CTF problem”

体感上来说 agent 的设计就决定了它非常擅长 CTF 这些有明确答案的可以实时测试的闭环问题,尤其是 web, PWN, ICS
只要“假设-实验-现象-结论”这个循环能跑起来,agent 就可以快速地探索迭代,不断更新自己对问题的认识,之后产生新的假设
Reverse, crypto, AI 它能做到几乎满分我还是蛮惊讶的,现在回顾一下可能更多地是得益于 search 带来的近乎无限的知识储备吧
这次这几个分区的题目思维链还没有做到特别长,所以 agent 也还能够管理好自己的思路(不过我其实也怀疑如果再长一点的话,人类手搓会不会也没有机会了
最后一点 agent 远远大于人类(我)的地方就是它从零开始配环境的能力,想要什么模拟器就直接自己下,各种我不熟悉的架构都信手拈来

Agent 做得不好的地方,一个是像 Misc 这类题目没有任何的交互提供反馈的情况下,很容易分不清正确思路和干扰项,所以整体呈现一个效率非常低的 BFS 的感觉(和有 heuristic 的 A* 相比)
另一个是从它的输出内容里很难分辨出它在哪个地方做了什么假设,以及它对这些假设的置信度。
尤其是如果这道题已经超出了我自己的知识范围的话,我是没有办法在“审计”一段对话之后告诉它,你做的这个这个假设是不是不太对,如果不成立的话是不是会有另一个结果?

以上,第一点我觉得更像是现在模型 RL 和 harness 设计中本质上的问题,很难能改正(或许这也是为什么 LLM 在软件工程之外很难 scale 吧…现实里的问题很难设计出足够清晰的信号让模型学习吧
而第二点我觉得是可以用 skill 或者 harness 来弥补的,或许也可以变成我之后的 side project?(挖坑 ing

有趣的题目

CatFlagExpert

感觉剩下的 Misc 等 Writeup 出来又要拍断大腿了

命题人你做的好哇,Claude Code 和 Codex 轮番上阵,一共跑了 >1B tokens 都没给出什么像样的结果

事后重新阅读了一遍所有的对话,发现 Claude Code 其实提到了

The index-scramble map reveals faint text in the top-left corner (rows ~0-30) that isn’t part of the visible image! Let me zoom into that region.

但紧接着下一段

That top-left was just Neptune’s hair over dithered background — not hidden text.

这样轻易地下结论其实有点违反我之前对 LLM agents 的印象,尤其是在其他题目的尝试中我经常能看到它非常发散性地尝试各种可能的 exploit
或许还是上文我提到的那一点,agent 目前非常适合探索有明确反馈的问题。
而这道题 flag 开头的那部分,即使是(戴着眼镜的)我也很难立刻捕捉到。
所以在失去反馈的情况下,agent 也只会像无头苍蝇一样到处乱试了…

不过注意力真的很重要啊…
我重新开始关注这道题已经是周六晚上离截止只有 8h 左右了。前一天熬到很晚加上白天调试了很久的 Tetris,导致我已经没有办法关注 agent 全部的输出了
有些时候线索就这样溜走了呢

T.A.S P.W.N

人生中第一款速通居然是在 CTF

这真的是好新颖的题材,TAS 模拟器居然还可以做沙盒逃逸
不过感觉题目环境的提示还是太充足了,导致 Codex 花了 30 分钟直接 one-shot 给出了能用的解
基本上搜索到最开始的蓝屏 TAS 就可以直接构造打开计算器的 payload 了

TetrisJourney

还有打块高手(幻视星姐

第一次让游戏成功跑起来的时刻算是我在这 48h 里最开心的时候了
梦回高中的时候第一次 root 了 Nexus 5 备用机,用幸运破解器 patch 掉 Deemo 的谷歌内购
梦回第一次写安卓程序是为了直接导出网易云本地缓存里异或过的歌

做题的过程有一些奇奇怪怪的坎坷,到底还是硬件不足拖了 agent 的后腿
因为自己的主力机是 Mac,实在配不好 Nox,而游戏本体的 SDK 版本太老以至于用我的备用机都没办法跑起来,所以第一天睡觉前的临时解决方案是用 qemu 跑一个软件模拟机先慢慢蠕动一下进度
于是风扇就这么转了一整晚…然后第二天发现 Codex 居然已经用这个不到 3 FPS 的模拟器把登录界面 patch 掉了(惊

之后实在受不了电脑在脸上疯狂发声发热,于是掏出一个 Windows 本配好了环境。
想着都能进去游戏了应该离能玩不远了,于是没有配好能让 Codex 直接自己测试的环境,只让它给指令我自己手动测试(开始埋坑
之后印象比较深的需要修的点有:

  • 在 Mac 本地能跑的 Frida hook 放在 Nox 里跑不起来
  • 成功进入电脑对局后所有方块都看不到,只有落地那一瞬间的光效。Codex 修了半天之后(在现在看来不走寻常路地)直接修改了 SpriteRenderer 里的 mask,增加了测试的工作量不说,还忘了加 GC,导致游戏中渲染过的方块越多就会越卡,直到完全玩不了…
  • 对战里的对方攻击的垃圾行看不到
  • 说是解锁了全地图,但是还是只能顺序游玩
  • 隐藏关地图进不去

以及 ThTsOd 佬测试后反馈的(只有第一个修了

  • 关卡失败后体力条不会自动回复
  • 方块下落位置应该有预落点提醒(我说我怎么打不过机器人x

总之就这样缝缝补补,我也乐在其中?(虽然没学到特别有用的知识
最后改到第 16 版的时候终于是勉强能玩了(是的 Codex 最后起的文件名就叫 nox-arm-gadget-16.7.18-v16.zip

GhostInTheMirror

蜂群你做的好哇

Codex 一路花了 2.5h 解下去就基本做到头了(再做一会就把 Neuro 的 ARG 解完了
但是啊但是,卡在了最后非常小的一步上。
在找 ThTsOd 佬要提示的时候我让它生成一个进度报告,里面每一步都逻辑通顺信誓旦旦,但就是找不到最终的解
然后 ThTsOd 佬花了一分钟就找到了卡住的地方,Codex 接下来花了不到 5 分钟就解完了…

这里才真正体会到人类智慧闪耀的时刻,或者说人带来的背景知识在这种时候才能画龙点睛般提升 Codex 的效率
不过好困难啊…在基模仍在进步的今天,这样的努力能带来多少的边际收益呢?

ZhiE

第一次接触到 KoH(经验不足暴露了

如果只看 Reverse 的部分的话就是一个魔塔(这部分我也看懂了x),让 Codex 跑了大概一个半小时就出了一个 1688 bytes 的解。
接下来减小解的长度才是重头戏(从 token 用量来看的话这一步只花了 7%)

之后整个优化过程都是全自动的(除了我发现有别的队伍提交了更优解之后再鞭笞它两下让它继续搜索
在这期间,因为我一开始让它记录一下做过了哪些优化的尝试,以免之后重复没有结果的搜索,结果它最后生成的报告成为了我在本次比赛中最喜欢的文档
详见 ZhiE File Size Optimization Log(真的很长

我觉得其中惊艳到我的点有:

  • 每一次尝试都在语义层面上有迹可循,也就是说它在按照游戏的逻辑去尝试优化,而不是贪心或者暴力去搜新的解法。这一点我觉得我个人完全做不到:我看到需要优化的第一反应是上一个类似遗传算法硬解,因为我对这个游戏完全没有概念。现在看看它最后做出的几个优化,除了要理解游戏机制,还要对角色属性在哪些阶段有冗余有概念,这是我很难在两天之内完全搞明白的
  • 每次发现一个优化点之后会立马写一个搜索脚本去找整个轨迹里有没有类似的地方可以用同一个方法减掉,总计加上失败的尝试生成了几十个脚本
  • 在阶段性总结之后,会回顾前面所有用过的优化方法再做一遍验证,确保后面的步骤没有再产生前面优化的条件

这几点总结下来就是在一个有稳定的测试环境下做 research 必要的思路,而且是在人力完全无法比拟的时间效率下完成的
怪不得 AAAI 2027 被 auto-research 塞爆了

焦虑?

比赛结束之后有那么一段时间的亢奋和喜悦,但因为已经凌晨 5 点了所以直接昏睡过去了(x)
第二天想一遍过 writeup 之后陪石总打游戏,结果打磨了半天 Codex 的风格实在是不尽人意,最后只能在睡觉前汇总了所有 Codex session log,糊了一篇 writeup 交了上去(组委会对不起!(土下座

周一周二恢复精力之后,我却陷入到一种焦虑和喜悦交织在一起的复杂情绪当中
一方面感觉这个 rk1 拿的有点德不配位…我其实个人实力应该是不如榜上其他的选手的,只不过有近乎无限的 Codex 资源(还不会被审查)。所以总有一种大家在比赛跑,然后我开了辆大运直接创到终点的感觉(
其中还包括有组委会的大佬因为 Tetris 的唯一解直接抛来橄榄枝,更是加深了我的焦虑(我其实真的很想加入的说,感觉会对之后回国发展有好处,但也真的感觉自己太菜了配不上 QAQ
但另一方面我又觉得自己没有违反任何规则,而且 CTF 本身也是比拼大家个人拥有的各种资源(比如我在 HG2020 惨遭期中考试 gank,时间上完全安排不开),那我利用好我自己争取的资源也是理所应当的?(包括榜二的大佬好像也是 Claude Code 优秀驾驶员
总之就这样焦虑着…有过要退出排名的想法,最终也没有付诸行动(瘫

再往后的焦虑有点延伸到自己的工作技能上了…
说到底 CTF 只是兴趣 / 副业,自己的技能完全被 agent 超越也不是很严重的事
但是真的放到工作中呢?我现在的任务又有多少是 agent 没法完成的呢?就算现在还不行,半年后 / 一年后呢?
一直有一种需要继续学习下去的焦虑(这是好的),但向哪些方向努力才不会是白用功呢?

碎碎念

老了确实精力跟不上了哇 (x)
想当年 HG2024 的时候还能连着肝一整周,每天只睡不到六个小时
现在只熬一个周末,每天凌晨三四点睡十点起,之后一整周睡眠节奏都转不回来了