StartLux-V1.0-27B-Preview本地Agent模型正式发布

互联网 来源:StartLux 2026-09-01 03:24:22

大家好,就是今天,StartLux正式与大家见面了!经过3个月的打磨,我们隆重推出第一个模型——StartLux-V1.0-27B-Preview。它也是国内首个以“AI训练AI”(Auto Research)方式完成后训练的本地Agent模型

为了客观检验模型的真实实力,StartLux参与了由工信部中国信息通信研究院(以下简称“中国信通院”)人工智能研究所组织开展的可信AI大模型基准测试——MCP专项测试StartLux-V1.0-27B-Preview在MCP-Universe基准测试中,以27B参数量取得综合性能排名第二的成绩,仅次于1.6万亿参数的DeepSeek-V4-Pro,总体指标差距仅1.30个百分点。

可信AI大模型基准测试——MCP专项测试涵盖位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D设计6类专项任务及综合评估,共7项检验项目,重点考察大模型在多工具协同、复杂任务执行及真实环境交互等方面的综合表现,该专项测试部分指标和数据参考了开源项目MCP-Universe[1]。参测模型包括DeepSeek-V4-Pro(1.6T)、DeepSeek-V4-Flash-0731(284B)、Step-3.7-Flash(198B)、StartLux-V1.0-27B-Preview(27B)、Qwen-3.6-27B(27B)和 AgentCPM-Explore(4B)。

结果显示,StartLux-V1.0-27B-Preview综合得分39.25%,排名第二,超过 284B的DeepSeek-V4-Flash-0731和198B的Step-3.7-Flash。在同等参数规模下,StartLux-V1.0-27B-Preview较Qwen-3.6-27B高出5.34个百分点。单项任务中更突出:位置导航排名第一,浏览器自动化三项指标与DeepSeek-V4-Pro并列第一,金融分析Pass@1并列第一、Pass@3独占第一,3D设计稳定性指标排名第一。

我们希望在模型规模、部署成本与实际 Agent 能力之间取得更好的平衡。为检验模型在真实工具环境中的工具调用与任务完成能力,我们选择了MCP-Universe作为评测基准。此次测评结果显示,经过后训练的StartLux-V1.0-27B-Preview,一款不到30B规模的稠密模型,已经进入万亿总参数模型的能力区间。这初步验证了我们的技术构想。

StartLux-V1.0-27B-Preview

定位与训练方法

StartLux-V1.0-27B-Preview以Qwen3.6-27B为基座模型,是一款面向工具调用与通用Agent场景的27B Dense 模型。

StartLux训练数据的设计重点在于增强模型的任务理解、工具选择、参数构造、多步执行、状态检查和结果验证等能力,同时使其学会根据不同任务要求与工具反馈,来调整执行策略,在出现异常或结果偏差时主动修正、重新执行并确认任务完成。

团队自主研发出一套全新、多维度、可验证、可规模化的模型迭代优化技术。在模型训练过程中,我们采用AI训练AI(Auto‑Research)的技术路线,让模型置身于真实工具环境中自主执行任务,并依托环境反馈持续迭代自身能力。该技术路径代表着当前全球模型研发的前沿方向。其中,StartLux‑V1.0‑27B‑Preview是国内首个采用该方案完成后训练的本地Agent模型。

基于MCP-Universe测评集开展测试

评价一个模型的工具调用能力,最直接的方式是检查它能否输出正确的函数名称和参数。但在真实Agent任务中,工具可能返回异常,外部状态持续变化,一个任务往往需要多工具、多步骤协同完成。即便单次调用未报错,最终结果仍可能与用户预期不符。基于以上,为全面评估模型在真实工具场景中的任务能力,我们最终选择参考 Salesforce AI Research公开的MCP-Universe数据集、评估方法与测试环境

基于 MCP-Universe 公开框架整理

MCP-Universe面向真实MCP Server与动态外部环境设计,覆盖六个实际领域,连接11个不同的MCP Server。与仅检查函数调用格式的测试不同,其评估体系关注四个维度:用户需要模型完成的目标;与任务相关的背景和约束;模型可以连接的MCP Server及工具;判断任务是否完成的评估规则。MCP-Universe采用基于执行结果的评测方式,同时检验输出格式合规性、静态结果正确性,并通过动态数据获取实时真值,以保证结果与真实需求贴合。

MCP-Universe是全球范围内具有公信力的公开评测体系,具有评测方法透明、任务结果可验证等特点。为进一步确保测试的客观性与可信度,StartLux-V1.0-27B-Preview还参与了中国信通院开展的独立检测。

后训练→全训练,开启模型进化新征程

面向未来,我们追求的是持续学习与自进化。我们正稳步推进模型训练工作,后续将开展扩散式语言模型等新型模型架构的研究。我们认为,未来的本地AI能够在用户授权、数据不离开设备的前提下,将每天的交互、任务反馈和执行结果转化为训练信号,在本地持续、小规模地更新模型参数,让长期经验不仅保存在Memory中,也逐渐沉淀为模型的自身能力。

参考文献

[1] LUO Z, SHEN Z, YANG W, et al. MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers[EB/OL]. arXiv:2508.14704, 2025[2026-08-24].

关于模型开放:

StartLux-V1.0-27B-Preview已完成阶段性训练与评测,目前相关备案工作正在推进,因此暂不向社会公众直接开放测试。

现阶段,我们仅在封闭、受控的测试环境中,面向少量特定受邀人员(如开发者、媒体、投资人及合作伙伴等)开放限量测试通道,用于模型能力验证和技术反馈收集,暂不开放公众注册或自助测试。如有测试需求,可发送邮件至contact@startlux.com提交申请,我们将根据测试安排分批邀请。

待相关备案工作完成后,我们将另行公布正式开放安排。

关注公众号:拾黑(shiheibook)了解更多

友情链接:

关注数据与安全,洞悉企业级服务市场:https://www.ijiandao.com/
安全、绿色软件下载就上极速下载站:https://www.yaorank.com/

公众号 关注网络尖刀微信公众号
随时掌握互联网精彩
内容推荐