冻结任务与测试设计
以下材料在正式模型运行前冻结;答案键单独保存,从未发送给模型。
评分、token 与成本计算
这些 CSV 是演示中得分矩阵和成本表背后的机器可读证据。
18 份未经修改的模型回答
每个 Markdown 文件都保存完整输入、九行原始回答、模型 ID、日期、设置和 token 用量。
解释边界
最终比较是每个模型一次正式运行、每次六个自编案例。得分、token 与 API 成本可以复算;审核秒数和 90 秒修正时间是估算。本实验支持案例集内比较,但不能证明模型在新政策或重复运行中的统计可靠性。