StartupBench:面向市场验证端到端工作流的通用智能体基准测试
StartupBench:面向市场验证端到端工作流的通用智能体基准测试
论文来源:arXiv:2608.17800v1 [cs.AI]
摘要
大语言模型与AI智能体的快速发展显著提升了AI系统处理复杂任务的能力。但现有基准大多由研究人员自行设计任务,无法确认模型能力是否可以迁移到现实用户真正需要完成的工作。本文提出StartupBench,一套基于经过市场验证的AI初创产品构建的端到端智能体评测基准。
本基准不从预设的智能体能力假设出发,而是系统调研已经获得市场采纳的AI产品、产品工作流以及真实用户,挖掘跨多个专业领域具备实际业务需求的真实任务。将这些业务工作流转化为面向交付物的完整任务,使用细粒度评分细则对复杂业务需求开展评估。
在统一智能体执行框架下对多款代表性模型开展评测,即便是当前最强模型,在StartupBench上任务完整成功率也仅约30%,尽管多数任务可以取得可观的部分进展。进一步分析表明:复杂指令遵循能力、领域专业知识是智能体主要故障来源。实验结果说明大量经过市场验证的业务工作流依然超出当前通用智能体可靠处理能力;StartupBench可以作为实证指标,衡量智能体完成真实用户端到端任务的能力。
1 引言

大语言模型正从信息检索问答系统,进化为能够完成复杂现实任务的智能体。现代AI系统需要执行端到端工作流、协调多种能力、在现实约束下产出满足业务要求的交付物。随着AI深度融入专业工作,自主完成用户委托任务成为衡量模型能力的重要指标。评估AI能否把模型能力转化为专业可用交付物,是下一代基准测试的核心挑战。
现有端到端任务评测基准取得不少进展,但仍存在显著局限:
- 任务来源偏向研究者视角:很多基准任务由研究人员定义,并非来自真实AI产品落地产生的业务需求,难以反映真实用户需求和交付标准。
- 评估粒度粗糙:部分基准虽然评估完整交付物,但评估协议粒度粗。现实业务产物包含大量功能、结构、格式、领域特有要求,整体性打分无法忠实衡量。
观察到:AI原生初创企业产品是真实工作流的天然来源——产品已经经过真实用户与商业需求验证,直接证明用户希望把这类任务委托给AI。基于此,本文构建StartupBench,一套调研+用户访谈驱动的基准数据集,覆盖多领域真实端到端业务需求。
设计原则
- 基于真实业务采纳获取任务:系统调研AI原生初创产品,结合产品演示、用户访谈,筛选具备现实需求的工作流,保留用户核心目标与业务约束,构建基准任务。
- 面向完整交付物:每个任务要求产出用户在真实工作流中期望得到的完整交付产物,而不是中间输出、简化演示案例。
- 细粒度评分细则评估:每个任务使用多条独立评分细则,覆盖交付物功能、结构、格式、领域质量等维度,全面忠实评估现实任务完成情况。
在统一智能体框架下评测主流模型,结果显示最强模型也仅能完成约30%任务。不同领域性能差异巨大,金融、ST(\mathcal{E})M计算机科学、教育人文领域挑战最高。故障根源主要来自复杂指令遵循缺陷与领域专业知识不足,为基础模型和智能体系统指明优化方向。
本文贡献
- 提出一套基于真实AI落地场景构建智能体基准的调研‑访谈方法论。
- 构建StartupBench基准:基于AI初创企业调研、企业用户访谈、面向用户任务抽象、专家数据构建、多轮质量校验完成数据集。
- 对现有基础模型、通用智能体开展大规模实证研究,提供评测信号,衡量AI智能体从“回答问题”走向“可靠完成真实工作”的进展。
图1 StartupBench总览:真实AI产品工作流、长时序智能体执行、六大领域覆盖、多格式交付物生成。
2 相关工作
2.1 商业AI智能体与垂直工作流
基础模型进步,让AI智能体逐步具备规划、工具调用、文件处理、多步执行能力,AI产品从通用对话助手转向面向工作流的垂直产品,覆盖文档处理、数据分析、金融研究、企业运营、知识工作。
现实世界AI价值,不只取决于孤立模型能力,更取决于能否封装成可用工作产物。但学术基准很少直接将商业落地采纳作为任务来源。StartupBench填补该缺口,任务源自经过市场验证的AI初创产品与深度用户,任务构建从研究者虚构场景转向真实需求驱动。
2.2 AI智能体端到端评测
智能体基准从单项能力评估演进到端到端任务完成评估。早期代表:AgentBench、GAIA,重点测试工具调用、多步推理、通用助手能力;后续工作拓展到网页交互、计算机操作环境;更近的基准走向专业、具备经济价值的任务:企业软件、模拟职场、职业任务、长时序工作流。
StartupBench延续该方向,但任务来源不同:不依赖公开环境、职业分类、模拟职场,而是取自AI原生初创产品、ToB用户需求、真实业务交付目标。
2.3 Agent‑as‑a‑Judge复杂交付物评估范式
智能体任务从简短回答转变为异构交付物(报告、表格、PPT、代码补丁、结构化文件),评估范式从能力打分转向交付物评估。
LLM‑as‑a‑Judge广泛用于开放生成评估,MT‑Bench、Prometheus研究偏好、评分细则驱动评判。针对智能体工作流,评判往往需要检索证据、读取文件、校验状态、检查约束。Agent‑as‑a‑Judge为评判器配备工具与环境交互能力;AJ‑Bench专门研究评判智能体的信息获取、状态校验、过程校验。
StartupBench采用交付物中心评估范式:结合专家编写评分细则,搭配自动评判智能体读取原始工件与证据视图,评估智能体是否将模型能力转化为可用工作产物。
表1 StartupBench与现有基准对比
| 基准 | 任务来源 | 最终输出 | 端到端(\mathcal{E})2(\mathcal{E}) | 分项评估 | 过程逻辑 | 开放生成 | 评估方式 |
|—|—|—|—|—|—|—|—|
| GAIA | 人工设计 | 文本 | △ | ✗ | ✗ | ✗ | 规则 |
| OSWorld | 真实+人工 | 环境状态 | △ | ✗ | ✗ | ✗ | 执行结果 |
| (\mathcal{D})AComp | 真实+人工 | 工作空间 | ✓ | ✗ | ✗ | ✓ | 混合 |
| G(\mathcal{D})Pval | 人工 | 工作产物 | ✓ | ✗ | ✗ | △ | 人工 |
| Workspace‑Bench | 模拟+人工 | 工作空间 | ✓ | ✗ | ✗ | ✓ | Agent‑as‑Judge |
| OneMillionBench | 专家撰写 | 文本 | △ | ✗ | △ | ✓ | LLM评判 |
| Agents’ Last (\mathcal{E})xam | 职业引导 | 工作空间 | ✓ | ✗ | △ | △ | 混合 |
| OfficeQA Pro | 语料派生 | 文本 | ✗ | ✗ | ✗ | ✗ | 答案匹配 |
| StartupBench(本文) | 市场验证+专家构建 | 工作空间 | ✓ | ✓ | ✓ | ✓ | Agent‑as‑Judge |
✓完全支持;✗不支持;△部分支持
图2 StartupBench数据构建流水线:筛选市场验证的初创智能体产品,收集真实用户工作流,构建任务工件与实例,多轮评审校准真实性与难度。
3 StartupBench数据集
StartupBench目标是评估模型/智能体完成用户已经委托给AI产品的真实工作流。任务必须同时满足:真实性、可解答、可评估、区分度;来自真实AI产品使用场景;具备足够输入信息求解;输出要求与评估标准清晰;难度可以区分不同模型性能。
单纯人工设计任务可控但脱离真实需求;直接提取产品演示案例真实,但缺少上下文、成功标准、可复现规范。本文采用调研‑访谈驱动多阶段流水线:调研市场验证AI初创企业;访谈深度用户还原使用上下文、目标、交付产物;领域专家把业务场景改造为基准实例;多轮质量校验保证真实性、可解答、可评估、难度区分。
3.1 数据集构建流程
3.1.1 初创企业调研,获取市场验证场景
筛选多领域开发智能体产品的AI初创企业;筛选标准:融资大于100万美元,具备付费用户或大规模用户使用证据。融资代表市场预期,付费/大规模用户代表产品不只是演示(\mathcal{D})emo。
本阶段收集20+初创智能体产品,作为后续访谈基础。
3.1.2 用户访谈挖掘场景与需求
针对每个候选产品,访谈不同领域深度用户,挖掘公开产品描述之外真实使用情况。访谈采集:使用上下文、用户目标、输入信息、期望交付物、成功标准、常见约束;整理为场景说明和代表性(\mathcal{D})emo案例,作为标注阶段的参考种子。累计访谈30+深度用户,每个候选产品至少收集1个(\mathcal{D})emo案例。
3.1.3 领域专家构建任务实例
以访谈得到的工作流说明、用户场景作为种子,招募50+领域专家重建基准任务。保留原始工作流目标、业务约束、交付物,同时改造为可复现评测实例。不合成虚构问题,而是标准化真实用户请求。
任务三条原则:
- 来自真实用户会委托AI智能体处理的工作请求;
- 端到端完整工作流,不是孤立子任务;
- 产出具体专业交付物,具备明确定义成功标准、细粒度评分细则,实现客观评估。
每个任务抽象为三元组:
KaTeX parse error: Can't use function '\(' in math mode at position 25: …T}=(q,\mathcal{\̲(̲\mathcal{E}\)},…
- qqq:自然语言用户任务指令;
- KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{E}\)}:工作空间,完成任务全部输入文件、资源;
- R={(pi,wi)}i=1n\mathcal{R}=\{(p_{i},w_{i})\}_{i=1}^{n}R={(pi,wi)}i=1n:带权重的评分细则集合,评估交付物不同维度质量。
详见附录A.1任务标注教程。该阶段产出150+候选任务,进入质量控制。
3.1.4 质量控制
- 专家交叉校验:每个任务至少由另一位领域专家独立审核,校验四点:任务描述、工作空间真实性正确性;重建后工作流保真;评分细则有效性;参考交付物和评估协议一致性。附录A.2详细评审标准。
- 难度校准:使用前沿模型做预运行,采用GPT‑5.5、Seed‑2.1‑Pro、GLM‑5.1抽样测试。剔除全部模型都可以高质量完成的简单任务(区分度不足)。如果失败来自指令模糊、工作空间信息不全、评估标准不完善,而非任务本身难度,则修改任务重新校验。
3.2 数据集统计信息
StartupBench包含97个真实工作流任务,覆盖6大领域:医疗健康、金融、法律、商业管理、ST(\mathcal{E})M计算机科学、教育人文。模拟真实办公环境,要求智能体理解上下文、遵循复杂约束、处理异构文件、产出可用工作产物。
每个任务平均 25.3条细粒度评分细则,覆盖6个维度,3个重要等级,支持长时序复杂工作流、多样化交付物的详细评估。
表2 StartupBench数据集统计
|类别|数量|占比(%)|
|—|—|—|
|全部任务|97|100.0|
|一级领域|6|‑|
|医疗健康|21|21.6|
|金融|18|18.6|
|法律|16|16.5|
|商业与管理|19|19.6|
|ST(\mathcal{E})M与计算机科学|16|16.5|
|教育与人文|7|7.2|
输出文件格式:(\mathcal{D})OCX、XLSX、PPTX、P(\mathcal{D})F、Markdown、图片、文本交付物。
3.3 StartupBench任务自动评估
任务三元组 KaTeX parse error: Can't use function '\(' in math mode at position 25: …T}=(q,\mathcal{\̲(̲\mathcal{E}\)},…;输入KaTeX parse error: Can't use function '\(' in math mode at position 13: (q,\mathcal{\̲(̲\mathcal{E}\)}),被测模型产出交付物集合KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{D}\)}。
构建轻量化证据视图 KaTeX parse error: Can't use function '\(' in math mode at position 22: …al{V}(\mathcal{\̲(̲\mathcal{D}\)}):提取文本内容、页面渲染图片,方便评判器浏览异构工件,同时支持随时读取原始文件。
不使用单一整体性打分;每条评分细则独立启动AgentJudge会话。大部分任务包含20+细粒度细则,覆盖功能、完整性、格式、领域特有需求。逐条评估避免不同评估维度互相干扰,确保每条需求都被显式校验。最终任务得分聚合所有细则评估结果。
遵循Agent‑as‑a‑Judge范式,单条细则评估由轻量智能体执行,不是单次模型前向推理。
JJJ代表评判提示词与评估协议;输入任务说明、交付物、证据视图、目标细则项pip_ipi,评判器输出二元判定yi∈{0,1}y_i\in\{0,1\}yi∈{0,1}(是否满足细则)和文本理由eie_iei。
KaTeX parse error: Can't use function '\(' in math mode at position 48: …g(J,q,\mathcal{\̲(̲\mathcal{D}\)},…
任务最终得分(0‑1归一化):
KaTeX parse error: Can't use function '\(' in math mode at position 25: …core}(\mathcal{\̲(̲\mathcal{D}\)},…
4 实验
4.1 实验设置
评测9个代表性模型,包含闭源、开源:
- 闭源模型:GPT‑5.6‑sol、GPT‑5.5、Gemini‑3.1‑Pro、Seed‑2.1‑Pro、Qwen‑3.6‑Max
- 开源模型:(\mathcal{D})eepSeek‑V4‑Pro、Kimi‑K3、Kimi‑K2.6、GLM‑5.1
可靠性保障:每个模型独立运行3次;任务得分报告95%bootstrap置信区间(10000次重采样)。
全部模型运行在统一Nanobot智能体框架,工具配置完全一致;单任务最大交互步数限制200步。每个任务初始化对应工作空间与输入查询;从指定输出目录收集智能体生成交付物。
自动评判同样运行在Nanobot框架,底层评判模型采用GPT‑5.5。
指标说明:
- 连续任务得分0‑100;
- 成功率Success rate:三次运行中,最终得分≥90记为任务成功。
4.2 主要实验结果
表3 StartupBench模型性能(三次独立运行取平均;加粗为每列最优,下划线次优)
| 模型 | 整体 | 医疗 | 金融 | 法律 | 商业 | ST(\mathcal{E})M | 教育 |
|---|---|---|---|---|---|---|---|
| 平均得分 | |||||||
| Kimi‑K3 | 73.67 | 80.03 | 62.38 | 69.45 | 83.90 | 68.34 | 77.71 |
| GPT‑5.6‑sol | 73.61 | 79.32 | 61.66 | 73.53 | 77.61 | 74.77 | 73.94 |
| GPT‑5.5 | 72.79 | 78.59 | 62.09 | 71.75 | 79.59 | 72.14 | 68.32 |
| Seed‑2.1‑Pro | 67.19 | 73.15 | 57.26 | 61.35 | 77.83 | 65.61 | 62.91 |
| Kimi‑K2.6 | 59.95 | 67.70 | 51.17 | 54.62 | 71.91 | 51.38 | 58.60 |
| GLM‑5.1 | 60.79 | 65.66 | 51.22 | 50.20 | 78.53 | 52.18 | 66.50 |
| Qwen‑3.6‑Max | 59.46 | 66.51 | 52.45 | 50.33 | 75.03 | 48.83 | 59.26 |
| (\mathcal{D})eepSeek‑V4‑Pro | 61.11 | 69.42 | 51.11 | 54.53 | 73.69 | 54.89 | 57.03 |
| Gemini‑3.1‑Pro | 49.73 | 54.05 | 41.00 | 43.49 | 61.18 | 45.88 | 51.23 |
| 成功率(≥90)% | |||||||
| Kimi‑K3 | 29.55 | 34.92 | 20.37 | 20.83 | 52.63 | 16.67 | 23.81 |
| GPT‑5.6‑sol | 31.27 | 33.33 | 27.78 | 22.92 | 38.60 | 33.33 | 28.57 |
| GPT‑5.5 | 26.80 | 30.16 | 22.22 | 25.00 | 38.60 | 22.92 | 9.52 |
| Seed‑2.1‑Pro | 22.34 | 19.05 | 16.67 | 14.58 | 45.61 | 20.83 | 4.76 |
| Kimi‑K2.6 | 13.06 | 15.87 | 14.81 | 6.25 | 24.56 | 4.17 | 4.76 |
| GLM‑5.1 | 16.49 | 12.70 | 16.67 | 8.33 | 36.84 | 8.33 | 9.52 |
| Qwen‑3.6‑Max | 15.12 | 11.11 | 16.67 | 10.42 | 33.33 | 6.25 | 4.76 |
| (\mathcal{D})eepSeek‑V4‑Pro | 16.49 | 20.63 | 16.67 | 8.33 | 29.82 | 10.42 | 0.00 |
| Gemini‑3.1‑Pro | 6.53 | 6.35 | 11.11 | 6.25 | 8.77 | 0.00 | 4.76 |
图3 StartupBench排行榜
主要观测结论:
- 即便是最强模型Kimi‑K3、GPT‑5.6‑sol平均得分73.67、73.61分;严格标准(≥90)完整成功率也不足三分之一。多数模型平均分落在55‑75区间:智能体可以取得大量部分进展,但很难完整交付满足专业标准的产物。平均分高 ≠ 任务完整成功率高。
- 领域差异巨大:商业管理任务整体最简单;金融领域难度最高。说明模型处理标准化结构化任务更好;对持续定量推理、跨文档一致性、多步校验类工作表现差。
- 模型领域各有长短:没有单一模型在全部专业领域持续领先。Kimi‑K3在医疗、商业占优;GPT‑5.6‑sol擅长金融、ST(\mathcal{E})M、教育;GPT‑5.5法律领域最优。
该结果解释垂直专用智能体依然具备实际业务价值;下一代基础模型的关键不是“能做专业任务”,而是可靠产出无需人工修改复核的交付产物。
4.3 评测框架有效性验证
将自动评判结果与领域专家标注做对照。抽取两个代表性模型全部任务输出,领域专家使用同样细则独立打分。
- 细则单条级别:自动评判与专家标注一致性 92.78%;
- 任务级别成功判定(得分≥90)一致性:92.84%。
消融实验:对比“逐条细则独立评判” vs “全部细则一次性丢给同一个评判智能体打分”。
一次性整体评判的人机一致性下降到83%;并且稳定性差,经常输出格式错误,平均每个评估需要2次以上重试。逐条独立评估,一致性更高、执行鲁棒性更强。证明把复杂评估拆解为多条轻量独立评判任务的必要性。
4.4 故障模式分析
4.4.1 结果层面故障分析
图4 不同细则维度模型加权通过率(越高越好)
模型在结构完整性、信息整合、输出展示维度表现更好;领域合规性是全部模型共同最大短板,计算精度同样薄弱。说明现代模型可以产出外观完整专业的工件,但可靠遵守领域规范、业务惯例、数值正确性依然是现实部署的主要阻碍。
表4 不同重要等级细则满足率(%)
|模型|辅助Auxiliary|重要Important|核心Core|
|—|—|—|—|
| Kimi‑K3 | 77.89 | 75.12 | 73.40 |
| GPT‑5.6‑sol | 77.59 | 74.47 | 73.07 |
| GPT‑5.5 | 75.12 | 75.09 | 72.07 |
| Seed‑2.1‑Pro | 70.83 | 69.85 | 65.77 |
| Kimi‑K2.6 | 66.64 | 63.56 | 57.82 |
| GLM‑5.1 | 64.58 | 61.40 | 60.68 |
| Qwen‑3.6‑Max | 65.39 | 62.17 | 58.08 |
| (\mathcal{D})eepSeek‑V4‑Pro | 66.50 | 62.97 | 60.05 |
| Gemini‑3.1‑Pro | 53.48 | 48.41 | 50.13 |
| 平均 | 68.67 | 65.89 | 63.45 |
普遍现象:辅助性要求更容易满足,核心关键要求更容易失败。9个模型中8个呈现该趋势。智能体经常完成表面次要要求,但决定任务成败的核心要求缺失。看起来取得很大进展,但产物依然无法投入实际使用。
输出格式不合规故障:针对56个明确指定输出文件类型的任务,没有模型做到100%格式合规,合规率区间86.3%‑97.6%。两类典型错误:生成错误后缀(需要P(\mathcal{D})F输出Markdown);漏输出部分要求文件(需要同时xlsx+docx,只输出其中一个)。
表5 显式输出格式要求任务的文件格式合规率
|模型|格式合规率(%)|
|—|—|
| Kimi‑K3 | 97.6 |
| Seed‑2.1‑Pro | 95.2 |
| GPT‑5.6‑sol | 94.6 |
| Qwen‑3.6‑Max | 94.6 |
| (\mathcal{D})eepSeek‑V4‑Pro | 94.0 |
| GPT‑5.5 | 93.5 |
| Kimi‑K2.6 | 92.9 |
| Gemini‑3.1‑Pro | 86.9 |
| GLM‑5.1 | 86.3 |
4.4.2 行为层面故障分析
-
复杂指令遵循缺陷(部分遵从)
现实复杂工作流对交付物施加大量约束:结构、计算逻辑、格式、可执行正确性。模型经常只满足最显眼的要求,忽略同等关键约束。产出物表面完整,但不满足全部验收条件。模型倾向于生成“看起来正确”的输出,而不是忠实执行全部指令约束。 -
自校验幻觉 Self‑Verification Hallucination
很多故障不是模型无法完成工作流;而是错误认为推理执行成功等价于交付产物合格。生成看似合理工件之后,模型复述自己的推理、执行步骤,当作已经完成校验,不会独立检查最终交付物是否匹配原始任务需求。微小但关键错误(单元格数值错误、I(\mathcal{D})不匹配、约束缺失、格式不一致)保留在输出中。模型混淆“推理过程执行”和“交付物校验”,属于部署中高频致命故障。详见附录(\mathcal{D}).1案例。 -
领域专业知识不足
模型输出行文流畅格式专业,但无法满足领域特有硬性约束;不同领域故障模式各不相同:
- 商业管理:表格、看板、公式、结构化报告正确性;
- 金融:来源标注、数值精度、估值假设、时序一致性;对账不足、数值自校验缺失、会计惯例错误;
- 法律:法律推理完备正确性;引用缺失、事实覆盖不全、法条支撑不足、事实‑规则映射错误;
- 医疗健康:平均分尚可,但安全风险高;用药时机、持续标准、出院规划错误直接损害临床可用性;
- ST(\mathcal{E})M计算机:对象精确对齐;代码、工程图纸、物料清单、系统组件之间关系;
- 教育人文:细粒度规则遵循;课程要求、学分分配、文档组织、文本连贯性。
附录(\mathcal{D}).2提供医疗领域故障示例。
4.5 执行框架(Harness)对StartupBench任务的影响
4.5.1 通用智能体框架的影响
主实验全部使用Nanobot框架。为确认性能差异来自模型本身,而不是框架实现;额外使用Hermes、Claude Code两套通用智能体框架,任务集、评估协议完全不变,仅替换执行框架。
表6 不同通用智能体框架性能对比
|模型|Hermes|Claude Code|Nanobot|最大‑最小差值|
|—|—|—|—|—|
|GPT‑5.5|71.00|70.11|72.79|2.68|
|GLM‑5.1|60.20|60.18|60.79|0.61|
|Qwen‑3.6‑Max|59.10|57.38|59.46|2.08|
|平均|63.43|62.56|64.35|1.79|
更换通用框架只会带来很小性能波动,平均最大最小差值仅1.79分;模型相对排序保持不变。说明StartupBench评测结果鲁棒,性能差距主要来自底层基础模型能力,不是特定框架实现细节。
4.5.2 通用智能体 vs 垂直专用初创智能体
对比通用智能体,和该任务对应的生产环境专用初创智能体。专用智能体经过领域模型选型、提示词、工具编排、工作流设计深度优化。
表7 通用智能体与专用智能体对比。Oracle General:每个模型‑任务取三次运行最好结果。
|智能体系统|平均得分|成功率|
|—|—|—|
|通用(全部运行平均)|64.26|19.74%|
|通用(Oracle取最优)|71.75|28.06%|
|垂直专用智能体|83.50|39.18%|
即便允许通用智能体多次尝试,取最好结果,依然显著弱于专用智能体(平均分差距11.75,成功率差距11.12%)。性能差距不能简单归因为随机波动。
结论:当前通用基础模型在统一框架下,还无法完全替代经过领域定制的专用智能体;短板集中在:复杂指令遵循、领域专业知识、业务惯例、长时序工作流执行。未来基础模型补齐这些能力,通用智能体有机会在不依赖领域定制框架前提下完成高价值专业端到端任务。
5 总结
本文提出StartupBench,一套评测智能体端到端专业工作流能力的基准,任务源自经过市场验证AI原生产品与真实用户业务需求。跨多领域任务实验表明:“取得部分进展”与“产出完全满足业务验收标准交付物”之间存在巨大鸿沟。该鸿沟主要由复杂指令遵循缺陷、领域专业知识、业务惯例、长时序工作流执行能力不足造成。StartupBench基于用户真实委托的工作流开展评测,提供衡量智能体实际业务能力的现实标尺,指明未来优化方向。希望该基准助力模型与智能体研发,不仅可以完成专业工作,并且产出可以直接投入使用的可靠结果。
6 作者贡献
项目负责人:Liya Zhu, Xin Ma, Tao Liu, Haodong Wang, Ge Zhang
核心贡献者:Jingzhe (\mathcal{D})ing, Qingshui Gu, Yongjie Zhong, Jinxiang Meng, Yuan Gao, Yunqiu Zhou, Hao Zhu, Jifeng He, Yongzhi Liao, Xinyi Zhang, Chaoxin Li, Yi Zhu, Xi Lin, (\mathcal{D})uju Zeng, Xiang Gao, Wen Zhang, Yunyang Wang, (\mathcal{D})uo Wang
贡献者:Huan Zhou, Zuo Wang, Jin Chen, Kaiyuan Zhang, Chuqian Yu, Tianhao Yu, Longxiang Liu, Jianbo Xue, Huimin Che, Jiahao Wang
赞助委员会:Yujia Qin, Jiaheng Liu
通讯作者:Ge Zhang,Shen Yan,Xiaolong Chang,Wenhao Huang
参考文献
原始参考文献数量庞大,完整列表参见原论文网页:https://arxiv.org/html/2608.17800v1
附录A StartupBench任务标注教程
A.1 任务构建
任务三元组 KaTeX parse error: Can't use function '\(' in math mode at position 25: …T}=(q,\mathcal{\̲(̲\mathcal{E}\)},…
- 输入查询 q:自然语言用户指令,包含任务背景、隐式约束、期望交付产物;源自真实工作场景。
- 任务工作空间 KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{E}\)}:提供给智能体完整环境,多模态源文件、资源、交互设置;自包含执行环境,输入工件齐全,保证可复现评测。
- 评分细则集合 R={(pi,wi)}\mathcal{R}=\{(p_i,w_i)\}R={(pi,wi)}:每条包含评分点pip_ipi和权重wiw_iwi。细粒度检查清单;分为6大维度,3个重要等级,见附录C。
A.2 交叉校验
每个任务至少由另一位具备专业背景的领域专家独立评审。不只看标注一致性,从多维度校验真实性正确性。
- 任务真实性:查询、配套工作空间真实;材料事实无误,无领域知识错误。
- 工作流保真度:忠实还原对应职业真实工作流程;偏离实际业务的任务修改或舍弃。
- 评分细则有效性:评估项对工作流有意义;描述清晰无歧义;权重合理反映任务优先级。
- 真值交付物校验:参考标准答案必须在整套细则拿到满分;如果参考产物和细则冲突,则修改产物或细则直到互相匹配。
附录B 领域专家背景
招募57位领域专家,覆盖全部6个领域:临床医学、法律、投资量化金融、软件开发AI、工程、商业咨询、教育人文。按专家专业背景分配任务。
表8 领域专家背景统计
|专家统计项|数值|
|—|—|
|领域专家总人数|57|
|专业从业经验中位数|5年|
|从业≥3年占比|68.4%|
|从业≥6年占比|42.1%|
|从业≥10年占比|24.6%|
|覆盖StartupBench全部领域|6/6|
附录C StartupBench评分细则说明
六大评估维度
- Structure & Completeness 结构与完整性:交付物齐全,文件组织、组件完整。
- Calculation Precision 计算精度:数值结果、公式、逻辑推理、事实一致性。
- Information Integration 信息整合:数据清洗、转换、聚合、统计、特征工程、建模等结构化数据处理。
- (\mathcal{D})omain‑Specific Compliance 领域合规性:业务逻辑、金融原则、法律推理、医学实践、教育标准等专家知识约束。
- (\mathcal{E})ngineering & Format 工程与格式:代码规范、表格工程、文档格式、可复现性、命名、技术规范。
- Output & Presentation 输出呈现:图表、排版、可读性、报告组织、交付物易用性。
表9 全部2453条评分细则维度占比
|类别|占比|
|—|—|
|结构与完整性|27.31%|
|计算精度|38.89%|
|信息整合|9.46%|
|领域合规性|15.49%|
|工程与格式|6.20%|
|输出呈现|2.65%|
|合计|100.00%|
细则三个重要等级
- Core核心(权重5):直接决定用户核心需求是否满足;违反会严重破坏正确性、可靠性、安全性、可用性。
- Important重要(权重3):高质量完成任务的关键;单项违反不一定完全不可用,但显著降低整体质量。
- Auxiliary辅助(权重1):主要影响细节、体验、美观,不破坏产物基础可用性。
权重聚合计算任务得分;整体权重分布:Core占59.10%,Important占34.33%,Auxiliary占6.57%。任务得分主要由决定任务成败的核心、重要需求主导。
附录(\mathcal{D}) 行为级故障模式案例
(\mathcal{D}).1 自校验幻觉 Self‑Verification Hallucination
任务要求:筛选11级全部成员;模拟路线签到直到成员达到12级门槛;输出(\mathcal{E})xcel工作簿,满足严格数值、格式约束。
智能体生成工作表、成员记录、输出列,表面完整;模型输出总结认为任务完成。但工件检查发现有效点数错误、成员名字不匹配等关键错误。
故障根源:模型没有独立校验交付物;把自己执行过程的总结当成验证;推理过程成功 ≠ 输出产物合格。
图8 自校验幻觉示例图说明
(\mathcal{D}).2 领域特有故障示例
医疗案例:模型输出排版精美的多学科治疗方案,行文专业,但多处违反关键安全治疗约束。故障不是写作质量差;而是无法将医学知识转化为安全可落地临床决策。
图9 领域专业知识不足故障示例图说明
资源链接汇总
- 论文HTML网页:https://arxiv.org/html/2608.17800v1
- 论文P(\mathcal{D})F:https://arxiv.org/pdf/2608.17800v1
- 项目主页:https://startupbench.github.io/
优化说明:完整保留原始论文全部实验配置、消融、表格、算法定义、附录内容;仅完成中文翻译、Markdown结构化排版,无删减实验步骤与评估逻辑。
如果你需要,我可以进一步输出:
- 论文核心要点摘要
- StartupBench与其他Agent基准横向对比简表
- 论文核心故障模式整理笔记。
更多推荐
所有评论(0)