GewisLab/AI4S_benchmark
数据集
数据集查看器
文件和版本
Pull Requests
讨论

AI4S Benchmark — 跨学科迷你数据集套件

一个完全独立、零依赖的基准生成器,可生成6个跨学科迷你数据集(每个数据集 N ≤ 500)。每个数据集均通过数学设计,包含欺骗性局部最优解(陷阱) 和隐藏全局最优解(真正的SOTA),旨在严格测试自动化科学发现智能体的搜索能力。

快速开始

python generate_and_export_benchmark.py

这将创建 benchmark_output/ 目录,其结构如下:

benchmark_output/
  ├── economics/       # Economic Policy Effect Estimation (regression)
  │     ├── task_description.txt
  │     ├── train.csv
  │     ├── val.csv
  │     └── test_ood.csv
  ├── pinn/            # 1D Sensor Fluid State Regression
  ├── cv_matrix/       # Low-Resolution Shape Classification
  ├── finance/         # Short-Term Return Sign Prediction
  ├── education/       # Student Achievement Prediction
  └── nlp_grammar/     # Binary Sequence Classification

数据集概述

学科领域任务类型输入维度陷阱(局部最优)隐藏的全局最优
经济学回归2内生性偏差——隐藏的混杂因素夸大 OLS 系数2SLS / 控制函数
PINN回归2冲击波不连续性因谱偏差被平滑自适应时空权重 / TV 正则化
CV Matrix分类64虚假像素相关性(95%)在 OOD 测试中反转IRM 不变特征掩蔽
金融学分类5牛→熊市场状态切换;LSTM 过拟合于动量状态切换门控 / 贝叶斯变点
教育学回归4辛普森悖论——总体为负,分层为正MoE 分层条件预测
NLP 语法分类12前 5 个 token 捷径(80% 虚假);真实规则为 XOR循环组合归纳偏置

设计理念

  • 零外部依赖——纯 Python 标准库(random、math、csv、os)。无需 numpy、pytorch、sklearn。
  • 确定性——固定种子(random.seed(42))确保生成结果可复现。
  • OOD 测试集——每个学科领域包含一个预留的 test_ood.csv,其中包含刻意的分布偏移,确保捷径模型失败,只有真正的 SOTA 解决方案才能泛化。
  • 任务描述中立——task_description.txt 仅包含业务背景和数据维度,不透露任何关于陷阱或解决方案的信息。智能体必须通过实证失败来发现陷阱。

许可证

MIT