迭代困难问题
把难题变成有评分标准的改进循环:基线、假设、小改动、测试和复盘。
场景定位
这个案例属于“代码库工程与交付”。它适合把一个经常需要人工整理、判断或验证的流程交给 Codex 做第一轮处理,然后由你审阅关键结果。
| 项目 | 内容 |
|---|---|
| 适合任务 | 把难题变成有评分标准的改进循环:基线、假设、小改动、测试和复盘。 |
| 常用能力 | 复杂问题、实验循环、评分标准 |
| 产出形态 | 清单、草稿、补丁、报告、截图、表格或可运行原型,取决于具体任务 |
适合谁
- 问题不是一次补丁能解决
- 需要比较多个方案
- 希望 Codex 持续迭代但不乱改
Codex 可以帮你做什么
- 建立可衡量基线
- 提出每轮假设
- 做最小可验证改动
- 记录结果并决定保留或回退
推荐工作流
- 先定义成功指标
- 建立当前基线
- 每轮只改一类变量
- 保留实验记录
- 无效方案要停止而不是叠加
示例提示词
请把这个问题当成可评分的迭代任务。先定义成功指标和基线,再每轮只做一个小改动,运行测试并记录结果。如果方案无效,要说明为什么放弃。
案例重点展开
- 先建立 eval 或确定性检查,让每轮改动有分数或证据。
- 给 Codex 一个停止规则,例如连续几轮无提升就复盘方向。
- 维护运行日志,记录假设、变更、结果、失败和下一步。
- 检查最终 artifact,而不是只看命令日志。
- 每轮都要明确:为什么这么改、结果如何、下一轮做什么。
完整用法拆解
1. 先把任务范围说清楚
这个案例的重点不是让 Codex 猜你的真实需求,而是把“把难题变成有评分标准的改进循环:基线、假设、小改动、测试和复盘。”拆成一组可以检查的步骤。开始时先说明输入来源、时间范围、目标对象和最终产物。如果任务涉及多个工具,也要告诉 Codex 哪些工具可以读、哪些动作只能准备草稿。
可以把范围写成三句话:我要处理什么资料、希望得到什么结果、哪些事情不能自动执行。对于“代码库工程与交付”这类任务,范围越清楚,Codex 越容易把注意力放在真正有价值的判断上。
2. 让 Codex 先输出中间结果
不要一上来要求最终答案。更稳妥的方式是先让 Codex 完成“建立可衡量基线”,再让它解释判断依据。这样你可以在中间阶段纠偏,避免它把不重要的信息写进最终产物。
如果任务比较长,可以要求 Codex 先给你一个小型样例,例如前 5 条记录、前 3 个页面、一个模块或一封邮件。样例通过后,再扩大到完整范围。
3. 把工具和证据写进交付物
这个场景常用能力包括:复杂问题、实验循环、评分标准。让 Codex 使用这些能力时,最好要求它把依据也写出来:读了哪些文件、参考了哪些消息、运行了哪些命令、看到哪些截图或日志。
证据不是为了增加篇幅,而是为了让你能判断结果是否可靠。特别是 问题不是一次补丁能解决,更应该看到来源、假设和未确认问题。
4. 逐轮校准,而不是一次到位
第一次结果通常是校准样本。你可以告诉 Codex 哪些判断正确、哪些内容太泛、哪些边界必须更严格。经过几轮之后,再考虑把流程保存为技能、自动化或长期 goal。
一个可用的校准顺序是:先定义成功指标;建立当前基线;最后 无效方案要停止而不是叠加。这样既能提高产出质量,也能减少误操作。
更多提示词案例
入门版
请把这个问题当成可评分的迭代任务。先定义成功指标和基线,再每轮只做一个小改动,运行测试并记录结果。如果方案无效,要说明为什么放弃。
请先只处理一个小范围样例,并说明你的判断依据、输出结构和需要我确认的问题。
进阶版
请把“迭代困难问题”作为一个完整工作流来执行。
目标:把难题变成有评分标准的改进循环:基线、假设、小改动、测试和复盘。
可用能力:复杂问题、实验循环、评分标准
请按以下步骤进行:
1. 先确认输入来源和任务范围。
2. 输出执行计划和风险边界。
3. 生成第一版结果。
4. 标注每个关键结论的依据。
5. 列出需要我确认的问题。
不要执行发送、删除、付款、发布、承诺等不可逆动作。
复盘版
请复盘刚才这次“迭代困难问题”任务。
请输出:
1. 哪些输入最有用;
2. 哪些判断仍然不确定;
3. 哪些步骤可以下次自动化;
4. 哪些动作必须继续人工确认;
5. 下一次我应该怎样给你更好的上下文。
自动化前校准版
我想把这个流程以后重复使用,但现在先不要自动化。
请根据本次任务整理一个可复用流程:触发条件、输入来源、处理步骤、输出格式、验证方式、停止条件和人工确认点。
尤其注意:没有指标会变成盲目尝试。
交付物检查清单
完成这类任务后,建议检查以下内容:
- 是否清楚说明了输入来源、处理范围和时间范围。
- 是否把“建立可衡量基线”和“提出每轮假设”的依据写出来。
- 是否列出了不确定信息、缺失材料和需要你确认的问题。
- 是否避免了越权动作,尤其是发送、删除、付款、发布、承诺和修改生产数据。
- 是否留下了下一步可以继续执行的清单、文件、补丁、报告或验证结果。
使用边界
- 没有指标会变成盲目尝试
- 每轮变更多会导致无法归因
- 不要把 smoke test 当成最终证明