HuggingFace镜像/Agents-A1
模型介绍文件和版本分析

Agents-A1:扩展能力边界,而非参数规模——350亿参数智能体实现万亿级性能表现

🏠 项目主页 | Technical Report 技术报告
Hugging Face Hugging Face | GitHub GitHub | Model Scope ModelScope

[!Note] 本仓库包含Agents-A1模型的权重及配置文件,采用Hugging Face Transformers格式。

这些资源与Hugging Face Transformers、vLLM、SGLang等工具兼容。


🔥 最新动态

  • 2026.7.14:🔥🔥 40亿参数模型正式发布。

  • 2026.7.8:🔥🔥 应社区用户强烈需求,我们的40亿参数模型将于未来几天推出——助力用户更快速、便捷地构建本地AI助手。

  • 2026.7.2:🔥🔥 基于Agents-A1,我们已发布一系列量化模型变体。详情请参见Agents-A1模型集合。此外,特别感谢mlx-community提供多尺度量化版本,让您可以在Mac设备上运行Agents-A1!

  • 2026.6.26:🔥🔥 我们开源了Agents-A1 35B-A3B模型,同时提供部分领域的评估代码及技术报告。


Agents‑A1是由InternScience研发的350亿参数混合专家智能体模型,旨在跨多个领域扩展异构智能体能力,包括长程搜索、工程开发、科学研究、指令遵循和工具调用。我们从两个维度研究智能体能力边界扩展:一是扩展长程任务轨迹,二是扩展异构智能体能力。

在长程任务轨迹扩展方面,Agents‑A1借助领域知识-动作基础设施进行训练,该基础设施能联合构建动作、观测结果和验证器输出,将智能体的任务处理过程转化为可训练目标。在异构智能体能力扩展方面,Agents‑A1提出三阶段训练范式以构建可扩展的通用智能体模型。首先,进行全领域监督微调,使基础模型与广泛的智能体行为对齐;其次,训练领域级教师模型,以捕捉各领域的专业知识;最后,提出多教师多领域在线策略蒸馏方法,并结合异构感知优化,提升跨领域知识迁移效率。

Agents-A1 Benchmark Overview

核心优势

  • 智能体推理能力:Agents-A1 擅长将复杂任务分解为可执行的子步骤,进行前瞻性规划,并根据中间结果调整策略。
  • 工具使用能力:原生支持函数调用与工具集成,能够与 API、代码解释器、搜索引擎及其他外部工具无缝交互。
  • 科学与专业推理能力:可处理工具集成的科学推理及专业知识问答。
  • 指令遵循能力:在不同领域中精准遵循详细、多约束条件的指令。

我们欢迎开发者和企业集成并试用 Agents-A1,并分享反馈意见。

性能表现

我们从六个方向评估了 Agents-A1 在实际智能体工作流和研究导向工作流中的表现,包括长周期搜索、工程任务、科学研究、指令遵循、通用智能体任务和科学智能体任务。尽管属于 ~35B 模型量级,Agents-A1 仍展现出与 GPT-5.5、DeepSeek-V4-pro 和 Kimi-K2.6 等前沿大模型极具竞争力的性能。它在多个挑战性基准测试中取得了整体最佳结果,包括 Seal-0(56.4)、HiPhO(46.4)、FrontierScience-Olympiad(79.0)、FrontierScience-Research(40.00)、IFBench(80.6)和 IFEval(94.8),同时在 BrowseComp(75.5)、XBench-DS-2510(86.0)、GAIA(96.0)、SciCode(44.3)、HLE with tools(47.6)和 MolBench-bind(56.8)等广泛任务中,在同类模型中排名最佳。这些结果表明,Agents-A1 兼具强大的长周期搜索能力、稳健的科学推理能力和可靠的指令遵循能力,是一款高性能且高效的智能体模型,缩小了与更大规模前沿模型的差距。

🥇 整体最佳    🟢 同类模型中最佳(~35B)

基准测试 📏 同类模型(~35B) 🚀 更大规模模型 ⭐ 我们的模型
Qwen3.5-35B-A3BQwen3.6-35B-A3BNex-N2-miniStep-3.5-FlashKimi-K2.6DeepSeek-V4-pro(Max)GPT-5.5(xhigh)Agents-A1
🔍 长周期搜索
BrowseComp61.067.9374.169.083.283.4🥇 84.4🟢 75.51
XBench-DS-251077.071.082.056.3🥇 90.0🥇 90.084.0🟢 86.0
Seal041.438.7449.5536.9450.4554.9542.34🥇 56.36
GAIA59.878.6482.5284.580.58🥇 98.0687.38🟢 96.04
⚙️ 工程任务
SciCode37.735.829.940.453.550.0🥇 56.1🟢 44.33
MLE-Lite24.2434.8534.8554.5562.1263.64🥇 72.73🟢 43.94
🧪 科学研究
HLE w/ tools47.436.232.023.1🥇 54.048.252.2🟢 47.6
HiPhO37.037.738.538.341.138.743.3🥇 46.4
FrontierScience-Olympiad64.560.352.061.073.076.078.0🥇 79.0
FrontierScience-Research2.52.95.06.717.913.326.7🥇 40.0
📋 指令遵循
IFBench70.264.454.0864.671.7773.4775.9🥇 80.61
LongBench-v259.057.759.657.562.0🥇 64.3-🟢 60.2
IFEval91.991.388.493.5394.4593.3593.35🥇 94.82
🤖 通用智能体任务
τ2-Bench🟢 81.279.074.5375.7781.93🥇 82.281.6379.81
VitaBench31.935.623.030.035.63🥇 49.0445.0🟢 38.75
🔬 科学智能体任务
MatTools21.015.934.144.9363.847.1🥇 68.8🟢 47.1
MolBench-bind46.048.751.445.9521.637.8🥇 62.2🟢 56.8

使用方法

SGLang

SGLang 是一个用于大型语言模型和视觉语言模型的快速服务框架。

使用 uv 安装 SGLang:

uv venv --python 3.12 --seed --managed-python
source .venv/bin/activate

uv pip install sglang

有关更多详细信息,请参见其文档。

以下命令将在 http://localhost:8000/v1 创建 API 端点:

  • 标准版(1 块 GPU,262K 上下文):

    python -m sglang.launch_server \
      --model-path InternScience/Agents-A1 \
      --port 8000 \
      --tp-size 1 \
      --mem-fraction-static 0.8 \
      --context-length 262144 \
      --reasoning-parser qwen3
  • 工具调用:

    python -m sglang.launch_server \
      --model-path InternScience/Agents-A1 \
      --port 8000 \
      --tp-size 1 \
      --mem-fraction-static 0.8 \
      --context-length 262144 \
      --reasoning-parser qwen3 \
      --tool-call-parser qwen3_coder

vLLM

vLLM 是一个用于大型语言模型(LLMs)的高吞吐量且内存高效的推理和服务引擎。

通过 uv 从主分支安装 vLLM:

uv venv --python 3.12 --seed --managed-python
source .venv/bin/activate

uv pip install vllm --torch-backend=auto

有关更多详细信息,请参阅其文档。

以下命令将在 http://localhost:8000/v1 创建 API 端点:

  • 标准版本(1 块 GPU,262K 上下文):

    vllm serve InternScience/Agents-A1 \
      --port 8000 \
      --tensor-parallel-size 1 \
      --max-model-len 262144 \
      --reasoning-parser qwen3
  • 工具调用:

    vllm serve InternScience/Agents-A1 \
      --port 8000 \
      --tensor-parallel-size 1 \
      --max-model-len 262144 \
      --reasoning-parser qwen3 \
      --enable-auto-tool-choice \
      --tool-call-parser qwen3_coder
  • 纯文本模式(跳过视觉编码器以释放 KV 缓存内存):

    vllm serve InternScience/Agents-A1 \
      --port 8000 \
      --tensor-parallel-size 1 \
      --max-model-len 262144 \
      --reasoning-parser qwen3 \
      --language-model-only

推荐的采样参数

为获得最佳生成质量,我们建议使用以下采样参数:

  • temperature:0.85
  • top_p:0.95
  • top_k:20
  • min_p:0.0
  • presence_penalty:1.1
  • repetition_penalty:1.0

智能体能力评估

为向社区提供一个统一的智能体评估代码库以进行公平比较,我们还开源了一个评估框架,用于评估智能体模型的核心能力,包括工具使用和多步推理。评估代码包含在本仓库的Agents-A1/evaluation目录中。

我们使用此框架在标准化且可复现的设置下评估已发布的模型。 具体而言,该模型在一系列面向智能体的任务上进行测试,这些任务要求模型理解用户目标、分解复杂指令、在必要时与工具或环境交互,并生成最终结果。模型卡片中报告的评估结果是使用上述开源框架生成的,以便用户能够复现实验、在相同协议下比较其他模型,并进一步扩展基准以适应新的智能体场景。(请注意: 为确保公平比较,我们报告的是其原始技术报告中的基准结果。如果某个模型未报告相应的基准结果,我们会使用与我们模型相同的评估协议对其进行评估。)

有关详细的评估脚本、任务定义、指标和复现说明,请参阅评估代码库。

引用

如果您觉得我们的研究工作对您有所帮助,欢迎引用我们的成果。

@misc{bai2026scalinghorizonparametersreaching,
      title={Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent}, 
      author={Lei Bai and Zongsheng Cao and Yang Chen and Zhiyao Cui and Shangheng Du and Yue Fan and Shiyang Feng and Zijie Guo and Haonan He and Liang He and Xiaohan He and Shuyue Hu and Yusong Hu and Songtao Huang and Yichen Jiang and Hao Li and Xin Li and Dahua Lin and Weihao Lin and Fenghua Ling and Dongrui Liu and Zhuo Liu and Runmin Ma and Chunjiang Mu and Haoyang Peng and Tianshuo Peng and Jinxin Shi and Luohe Shi and Boyuan Sun and Zelin Tan and Shengji Tang and Qianyi Wang and Yiming Wu and Yi Xie and Xiangchao Yan and Jingqi Ye and Peng Ye and Fangchen Yu and Jiakang Yuan and Bihao Zhan and Bo Zhang and Chen Zhang and Shufei Zhang and Shuaiyu Zhang and Wenlong Zhang and Yiqun Zhang and Junpeng Zhao and Zhijie Zhong and Bowen Zhou and Yuhao Zhou},
      year={2026},
      eprint={2606.30616},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2606.30616}, 
}