冻结任务与测试设计
以下材料在正式模型运行前冻结;答案键单独保存,从未发送给模型。
测试执行架构
Promptfoo 负责组织“冻结提示词 × 六个案例 × 三个模型提供方”的测试矩阵;随后再对保存的模型输出进行评分与成本复核。
Promptfoo 官方架构介绍
课堂介绍时可用来说明模型提供方、测试案例、矩阵比较与评分工作流。
本项目的完整实验配置
实际使用的模型、提示词、六个案例、输出限制与执行参数。
评分、token 与成本计算
这些 CSV 是演示中得分矩阵和成本表背后的机器可读证据。
18 份未经修改的模型回答
每个 Markdown 文件都保存完整输入、九行原始回答、模型 ID、日期、设置和 token 用量。
解释边界
最终比较是每个模型一次正式运行、每次六个自编案例。得分、token 与 API 成本可以复算;审核秒数和 90 秒修正时间是估算。本实验支持案例集内比较,但不能证明模型在新政策或重复运行中的统计可靠性。