一个完全独立、零依赖的基准生成器,可生成6个跨学科迷你数据集(每个数据集 N ≤ 500)。每个数据集均通过数学设计,包含欺骗性局部最优解(陷阱) 和隐藏全局最优解(真正的SOTA),旨在严格测试自动化科学发现智能体的搜索能力。
python generate_and_export_benchmark.py这将创建 benchmark_output/ 目录,其结构如下:
benchmark_output/
├── economics/ # Economic Policy Effect Estimation (regression)
│ ├── task_description.txt
│ ├── train.csv
│ ├── val.csv
│ └── test_ood.csv
├── pinn/ # 1D Sensor Fluid State Regression
├── cv_matrix/ # Low-Resolution Shape Classification
├── finance/ # Short-Term Return Sign Prediction
├── education/ # Student Achievement Prediction
└── nlp_grammar/ # Binary Sequence Classification| 学科领域 | 任务类型 | 输入维度 | 陷阱(局部最优) | 隐藏的全局最优 |
|---|---|---|---|---|
| 经济学 | 回归 | 2 | 内生性偏差——隐藏的混杂因素夸大 OLS 系数 | 2SLS / 控制函数 |
| PINN | 回归 | 2 | 冲击波不连续性因谱偏差被平滑 | 自适应时空权重 / TV 正则化 |
| CV Matrix | 分类 | 64 | 虚假像素相关性(95%)在 OOD 测试中反转 | IRM 不变特征掩蔽 |
| 金融学 | 分类 | 5 | 牛→熊市场状态切换;LSTM 过拟合于动量 | 状态切换门控 / 贝叶斯变点 |
| 教育学 | 回归 | 4 | 辛普森悖论——总体为负,分层为正 | MoE 分层条件预测 |
| NLP 语法 | 分类 | 12 | 前 5 个 token 捷径(80% 虚假);真实规则为 XOR | 循环组合归纳偏置 |
random、math、csv、os)。无需 numpy、pytorch、sklearn。random.seed(42))确保生成结果可复现。test_ood.csv,其中包含刻意的分布偏移,确保捷径模型失败,只有真正的 SOTA 解决方案才能泛化。task_description.txt 仅包含业务背景和数据维度,不透露任何关于陷阱或解决方案的信息。智能体必须通过实证失败来发现陷阱。MIT