本附录分两部分。第一部分为正文各“研究支持”框对应的公开文献:每条给出它支持的正文主张、文献信息与一句话要点。这些研究的结论方向与幅度高度依赖模型与任务,且随模型代际变化——正文引用它们时的限定语(“不同模型表现并不一致”“不作为定律引用”)同样适用于本附录。第二部分为本书自有实验的条件记录模板。
编排说明:文献按正文主张分组而非按章分组;同一文献可支持多处。arXiv 编号供检索,正式引用格式以出版发表版本为准。
一、文献
主张 1:模型需要同时遵循的指令越多,遵循能力越可能下降(第 1 章)
- Jiang, Y. et al. FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models. ACL 2024, arXiv:2310.20410. 逐级叠加约束数量进行测量,观察到随约束增多遵循表现下降,且不同模型的退化形态不同——与第 1 章“退化形态、位置和幅度并不相同”的表述对应。
主张 2:长上下文中信息位置影响其被利用的程度(第 6 章;第 1 章哨兵实验的参照)
- Liu, N. F., Lin, K., Hewitt, J. et al. Lost in the Middle: How Language Models Use Long Contexts. TACL 12:157–173, 2024(arXiv:2307.03172). 观察到关键信息位于上下文中部时利用率下降的 U 形曲线;论文同时表明该效应因模型而异——这是正文“不宜当作固定规律套用”限定语的直接依据。
主张 3:信息分散在多轮中给出比一次给全更容易失败;轮数增加,遵循下降(第 8 章)
- Laban, P., Hayashi, H., Zhou, Y., Neville, J. LLMs Get Lost in Multi-Turn Conversation. arXiv:2505.06120, 2025. 20 万+ 模拟对话的大规模实验:论文所测试的开放权重与闭源模型在多轮欠指定设定下显著低于单轮,六类任务平均下降约 39%;并把退化分解为“能力小幅下降+不可靠性显著上升”——后者与第 19 章把方差本身当作指标、以及 strict k/k 的动机直接相通。配套代码:github.com/microsoft/lost_in_conversation。
主张 4:示例的数量、顺序与选择影响结果,且结论依赖任务与模型(第 4 章)
- Brown, T. et al. Language Models are Few-Shot Learners. NeurIPS 2020, arXiv:2005.14165. 少样本上下文学习的早期代表性工作之一。
- Lu, Y. et al. Fantastically Ordered Prompts and Where to Find Them: Overcoming Few-Shot Prompt Order Sensitivity. ACL 2022, arXiv:2104.08786. 示例顺序敏感性;“好的顺序”难以跨模型迁移。
- Min, S. et al. Rethinking the Role of Demonstrations: What Makes In-Context Learning Work? EMNLP 2022, arXiv:2202.12837. 示例的格式与分布信息有时比标签正确性更重要——支持第 4 章“模型会一并学习你没打算演示的东西”。
- Agarwal, R. et al. Many-Shot In-Context Learning. NeurIPS 2024, arXiv:2404.11018. 长上下文条件下继续增加示例仍能带来收益——第 4 章“也有工作发现……仍能带来收益”所指。
- Sclar, M. et al. Quantifying Language Models’ Sensitivity to Spurious Features in Prompt Design (FormatSpread). ICLR 2024, arXiv:2310.11324. 提示格式的微小变化可导致显著性能波动——语义变体用例(第 19 章)的研究侧对应物。
方法学参照:可程序化验证的评测(第 19 章)
- Zhou, J. et al. Instruction-Following Evaluation for Large Language Models (IFEval). arXiv:2311.07911, 2023. 提出可程序化验证的指令遵循基准,为“能写成断言的绝不交给判分模型”提供方法学参照。注意:它证明的是“这类约束可以被程序判定”,并不直接支持“指令越多表现越差”。
主张 5:显式引导推理过程可在部分任务上提升表现(第 4 章)
- Wei, J. et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022, arXiv:2201.11903.
- Kojima, T. et al. Large Language Models are Zero-Shot Reasoners. NeurIPS 2022, arXiv:2205.11916.
以上结论限于相关论文所测试的模型、任务与规模区间,不作为跨模型通用规律。
主张 6:显式流程控制与自由生成之间的差异(前言)
- Wu, Y. et al. StateFlow: Enhancing LLM Task-Solving through State-Driven Workflows. arXiv:2403.11322, 2024. 以显式状态组织多步任务,并与 ReAct 等方法进行比较,为前言关于显式流程控制的讨论提供研究参照。
二、本书自有实验的条件记录
正文声明来自本项目的实验与观察,条件记录如下。原始记录未完整保留的项,如实标注“当时未记录”——这本身就是第 19 章判分纪律的一部分:不补造数据。
E-1 提示词对照:示例性对照方法(第 3 章)
正文第 3 章的三份提示词对照,其原始运行记录未完整保留,此处不发布数字结果,仅给出可复现的方法设计:同一任务与同一批输入样本,仅提示词不同;输出按同一契约代码判分(结构断言+闭合枚举+失败出口);每份提示词各运行 k 次取 strict k/k;比较通过率与失败分布,而不比较单条输出的“观感”。配套仓库停靠点 A 即该方法的可运行实现。
E-2 上下文消融:示例性消融方法(第 6 章)
正文第 6 章的配置 A–E 消融,其原始运行记录未完整保留,此处不发布数字结果,仅给出方法设计:固定回归集与判分口径,逐项增删上下文成分,每种配置完整复跑回归并记录通过率、token 与延迟;已知局限是成分加入顺序会影响结论(正文已声明),因此结论只在被测的顺序与组合内有效。
E-3 重构前后回归(第 1、19 章)
表 E-1 重构前后回归的已知实验条件
| 项 | 记录 |
|---|---|
| 回归表版本 | 53 条(重构前夕建立) |
| 新版结果 | 48/53 |
| 基线说明 | 旧版无同口径完整基线(正文已声明,不用于证明提升幅度) |
| 判分方式 | 状态断言+require/forbid/regex+问句计数,无模型判分 |
| 运行次数与模型版本 | 当时未记录 |
E-4 跨模型迁移
正文第 21 章已明确相关判断“是推理,不是实验结论”;本附录不设占位表,跨模型实测完成后再以独立小节发布。
三、在线附录说明
第 6 章“参数以在线附录为准”指提示词缓存的触发条件、最小长度与计费规则——这些属于各平台实现细节且随时间变化,不进入纸面附录。在线更新与勘误统一从 https://prompt2system.com 进入;具体平台参数页只有在内容上线并完成访问验证后,才写入带版本号的发布稿。