只读实验档案 · 2026 年 8 月 4 日复核

切换测试实验材料

这里可以直接打开冻结输入、答案键、评分数据、成本计算,以及课堂比较所使用的 18 份未经修改的模型回答。原始实验文件均为英文。

冻结任务与测试设计

以下材料在正式模型运行前冻结;答案键单独保存,从未发送给模型。

评分、token 与成本计算

这些 CSV 是演示中得分矩阵和成本表背后的机器可读证据。

18 份未经修改的模型回答

每个 Markdown 文件都保存完整输入、九行原始回答、模型 ID、日期、设置和 token 用量。

解释边界

最终比较是每个模型一次正式运行、每次六个自编案例。得分、token 与 API 成本可以复算;审核秒数和 90 秒修正时间是估算。本实验支持案例集内比较,但不能证明模型在新政策或重复运行中的统计可靠性。