NeoHorse-1 – 基元律动联合无问芯穹等开源的 Agent 模型
NeoHorse-1是什么
NeoHorse-1 是基元律动联合无问芯穹、清华、北大、港中文、阿里巴巴等推出的开源 Agent 模型,含 4B 与 9B 两版。模型采用 Agent-Native 后训练,用 Routing Harness 的真实执行轨迹为训练数据,将路由信号复用为训练课程排序依据,实现评测反馈→数据配比→模型更新闭环。模型覆盖工具调用、任务规划、深度搜索与代码生成,9B 版均分 69.04、超底座 3.44 分,原生支持 26 万 token 上下文,可本地部署。

NeoHorse-1的主要功能
- 工具调用:根据任务需求自动选择并调用外部工具,完成多步骤操作。
- 任务规划:将复杂任务拆解为可执行的子步骤,并进行长程规划与调度。
- 深度搜索:在多轮交互中主动检索、整合信息,支撑结论的证据链。
- 代码生成:生成可用代码并基于环境反馈调试修复,直至任务完成。
NeoHorse-1的技术原理
Harness 轨迹驱动的 Agent-Native 训练:训练语料用 Routing Harness 真实执行产生的结构化轨迹为核心,涵盖请求、路由、工具调用、环境反馈与错误恢复,较传统问答语料多出能力需求、执行决策、环境结果三个维度。成功与失败轨迹均被保留,经结构检查与六维质量评估后入选,使训练目标直接指向任务完成。
能力引导的数据配比:路由器将任务按能力需求分为 C0–C3 四档,信号离线复用为训练依据:将路由记录拆为”预测—行动—结果”三段,用预测段排课程、用结果段定位能力短板,据此调整下一轮数据配比,形成评测反馈→数据配比→模型更新闭环。
递归自我改进(RSI)的单轮验证:分 Data-RSI 与 Model-RSI 两部分:前者指模型持续执行产生新轨迹、筛选后作为后续训练材料自然积累;后者指按评测短板更新模型并放回 Harness 模型池。当前仅验证单次闭环,信号与奖励设计仍由人类设定。
微信关注回复“开源”,加入AI开源项目交流群
如何使用NeoHorse-1
- 安装下载工具:执行 pip install -U modelscope 安装 ModelScope 命令行工具。
- 下载模型:运行 modelscope download --model TokenRhythm/NeoHorse-1-9B --local_dir ./NeoHorse-1-9B 拉取权重(4B 版本同理,按需选择)。
- 部署服务:使用 SGLang(pip install "sglang==0.5.17")或 vLLM 启动推理服务,配置 --context-length 262144、--reasoning-parser qwen3 和 --tool-call-parser qwen3_coder。
- API 调用:通过 OpenAI SDK 将 base_url 指向本地服务地址(如 http://localhost:8000/v1),即可像调用 OpenAI 接口一样发送请求。
- 注意资源:实际可用上下文取决于 GPU 显存,显存不足时可先降低上下文长度再部署。
NeoHorse-1的核心优势
- Agent-Native 训练:训练数据直接来自真实执行轨迹而非传统问答语料,目标直指任务完成,而非通用模型的事后适配。
- 失败轨迹利用:训练集同时保留成功与被替换的失败记录,让模型学会”哪里易错、出错后如何恢复”。
- 路由信号复用:将在线路由的 C0–C3 能力分档信号离线转化为训练依据,实现”评测反馈→数据配比→模型更新”闭环。
- 小尺寸高性能:4B 版 Agent 表现已超越多个参数量更大的通用模型,9B 版均分 69.04、超底座 3.44 分,部署成本更低。
- 超长上下文:原生支持 262,144 tokens,可扩展至约 101 万 tokens,适配长程 Agent 任务。
NeoHorse-1的项目地址
GitHub仓库:https://github.com/TokenRhythm/NeoHorse
HuggingFace模型库:https://huggingface.co/collections/TokenRhythm/neohorse-1
arXiv技术论文:https://arxiv.org/pdf/2609.08183
NeoHorse-1的同类竞品对比
| 对比维度 | NeoHorse-1-9B | Qwen3.5-9B |
|---|---|---|
| 十项基准均分 | 69.04 | 65.60(+3.44 分) |
| QwenClawBench(Harness Agent 任务) | 48.73 | 44.04 |
| PinchBench(标准化工作流) | 82.25 | 74.55(+7.70) |
| BFCL v4(函数调用/工具使用) | 67.43 | 64.88 |
| tau²-Bench(多轮人机工具交互) | 90.82 | 88.04 |
| HumanEval(代码正确性) | 98.17 | 92.68 |
| 训练方式 | Agent-Native 后训练:Harness 轨迹 + 路由信号课程 + 在策略蒸馏 | 通用四阶段后训练,无 Agent 执行轨迹 |
| 训练数据 | 真实执行轨迹(含失败与恢复记录),六维质量评估筛选 | 通用语料 + 合成数据 |
| 上下文长度 | 262,144 tokens(可扩展至约 101 万) | 长上下文(相对较短) |
| 协议/生态 | Apache-2.0,SGLang/vLLM/Ollama 等全框架支持 | Apache-2.0,通用模型 |
| 定位 | 专精 Agent 场景(工具调用、规划、深搜、代码) | 通用推理与对话 |
NeoHorse-1的应用场景
- 智能体任务执行:作为 OpenClaw 等 Harness 中的执行模型,自动完成文件操作、软件使用等真实电脑任务,并在失败后自主恢复。
- 工具调用与 API 编排:在多工具环境中自动选择、组合并调用外部 API,适合构建自动化工作流助手。
- 深度搜索与研究助理:多轮主动检索、交叉验证信息并附证据链,支撑带引用的调研报告生成。
- 企业办公自动化:在 WorkBuddy Bench 类多领域职场场景中处理日程调整、数据整理、报表生成等长程多步骤任务。
-
ffmpeg-skill – 开源的本地化视频剪辑与处理 Agent Skill
ffmpeg-skill是什么ffmpeg-skill 是面向编程 Agent(Claude Code/Cursor/Codex)的开源 Agent Skill,让 AI 能像专业剪辑师一样调用本地
-
EchoWM – 京东开源的交互式视听世界模型
EchoWM是什么EchoWM 是京东探索研究院开源的交互式视听世界模型。模型延续JoyAI-Echo的原生音视频生成能力,让用户以第一/第三人称视角在AI生成的世界中实时移动探索,画面、空间关系与环
-
teamai-cli – 腾讯开源的 AI 团队协作 CLI 工具
teamai-cli是什么TeamAI CLI 是腾讯开源的 MIT 协议 CLI 工具,用于统一管理团队的 AI 编程配置。工具将 skills、rules、MCP、hooks 等资源存入 Git
关注公众号:拾黑(shiheibook)了解更多
友情链接:
关注数据与安全,洞悉企业级服务市场:https://www.ijiandao.com/
安全、绿色软件下载就上极速下载站:https://www.yaorank.com/







聂傲娇
关注网络尖刀微信公众号
