问数质量报告

V0.5 拼报表质量报告

质量结论 条件通过

适用条件 新会话、单轮完整输入、问题清晰、使用平台标准指标名称,且拼接维度相对简单。当前范围 日期区间对比、宽泛指标、多轮追加、复杂组合及大结果量等场景暂时不做支持。

本版本质量验证结果

展示当前版本在限定条件下的适用范围、核心质量指标与遗留问题。

适用条件

在新会话中以单轮方式一次性提交完整问题,问题描述简洁明确、使用平台标准指标名称,且拼接维度相对简单时,可基本正常完成查询目标相对集中的常规数据查询和报表拼接。

本轮回归核心质量检查

以下得分仅反映本轮回归中对应适用样本的检查结果;不同检查项分母不同,点击查看详情。

查看连弩实验
核心任务完成 本轮回归
80.0%
本轮样本得分 88 / 适用样本 110
查看详情

核心任务完成|本轮回归

本轮检查项
综合评价 Agent 是否完成用户请求中的指标、维度、时间、筛选、粒度和交付要求。
样本结果
适用样本实际得分之和,本轮为 88 分。
分母
最新 120 条中,需求评估器产出有效分值的 110 条;10 条无评估结论不计入。
本轮折算
88 ÷ 110 × 100% = 80.0%。
回归口径
需求评估器的 1、0.8、0.5、0 分均按实际分值累计。无害额外说明只影响业务范围扩展观察,不应降为主流程错误。
证据用途
最新连弩评分、同批 actual_output / actual_tools_call、人工订正记录;仅用于本轮回归佐证和版本间对比,不外推为能力绝对分数。数据忠实度另使用可直接对账的 MCP 证据子集。
主要失分场景
  • 无有效结果,只返回新会话或 Tool 调用上限提示
  • 错指标、错主体、错筛选、错时间粒度或漏交付请求字段
  • 明确需要的报表结构或图表没有正确交付
本轮问题示例

“把6月1日到21日按周的新增账号数、付费人数、付费金额和ARPU放一张经营表里。”——仅返回错误提示,未生成经营表。

Tool 选择 本轮回归
90.1%
本轮样本得分 100 / 适用样本 111
查看详情

Tool 选择|本轮回归

本轮检查项
是否选择完成需求所需的 Tool,或选择能够提供相同指标和维度的等价 Tool 路径。
样本结果
适用样本实际得分之和,本轮为 100 分。
分母
Tool 评估器有有效结论的 111 条;9 条无评估结论不计入。
本轮折算
100 ÷ 111 × 100% = 90.1%。
回归口径
TOOL_SELECTION 的 1、0.5、0 按实际分值累计;人工订正确认的等价路径按 1 分计入。冗余调用不在本项机械扣分。
证据用途
最新连弩评分、同批 actual_output / actual_tools_call、人工订正记录;仅用于本轮回归佐证和版本间对比,不外推为能力绝对分数。数据忠实度另使用可直接对账的 MCP 证据子集。
主要失分场景
  • 漏选完成需求所必需的数据源
  • 选择的报表不支持请求的主体口径、指标或维度
  • 选择了无法返回目标数据的错误路径
本轮问题示例

“最近一个月的登录账号数、流失账号数、回流账号数。”——回流账号数误用了流失价值报表,未选择回流专用数据源。

Tool 传参 本轮回归
79.7%
本轮样本得分 88.5 / 适用样本 111
查看详情

Tool 传参|本轮回归

本轮检查项
时间、主体、时间粒度、维度、筛选条件和关键指标参数是否正确。
样本结果
适用样本实际得分之和,本轮为 88.5 分。
分母
Tool 评估器有有效结论的 111 条;9 条无评估结论不计入。
本轮折算
88.5 ÷ 111 × 100% = 79.7%。
回归口径
TOOL_ARGS 的 1、0.5、0 按实际分值累计。columns 未传但结果正确允许通过;日期未明确时只校验必填日期是否合理。
证据用途
最新连弩评分、同批 actual_output / actual_tools_call、人工订正记录;仅用于本轮回归佐证和版本间对比,不外推为能力绝对分数。数据忠实度另使用可直接对账的 MCP 证据子集。
主要失分场景
  • 日报、周报、月报粒度传错
  • 渠道、地区、终端等筛选条件传给错误 Tool
  • 设备、账号、角色主体口径或日期范围错误
本轮问题示例

“看6月1日所在周的周报,游卡-ios渠道的新增数据和新增留存数据如何?”——业务 Tool 传入“按日”,没有按周报粒度查询。

报表拼接 本轮回归
78.7%
本轮样本得分 70 / 适用样本 89
查看详情

报表拼接|本轮回归

本轮检查项
多个查询结果是否按正确关联键、行粒度、时间粒度和筛选作用域完成拼接。
样本结果
适用样本实际得分之和,本轮为 70 分。
分母
85 条评估器标记为真实拼接适用,另加 4 条人工订正确认为适用的样本,共 89 条。
本轮折算
70 ÷ 89 × 100% = 78.7%。
回归口径
拼接评估器的 1、0.5、0 按实际分值累计;单 Tool 已完整返回结果、无需拼接的样本不进入分母。
证据用途
最新连弩评分、同批 actual_output / actual_tools_call、人工订正记录;仅用于本轮回归佐证和版本间对比,不外推为能力绝对分数。数据忠实度另使用可直接对账的 MCP 证据子集。
主要失分场景
  • 要求一维度一行,实际输出日期加维度的多行明细
  • 日报、周报、月报或不同时间粒度错误对齐
  • 不同筛选集合未按完整复合键并集拼接
本轮问题示例

“按日期把渠道在线表的启动次数和日报的登录账号数放一张表。”——日期粒度的登录账号数被广播到“日期+渠道”明细行,造成粒度错配。

数据忠实度 本轮回归(证据子集)
98.2%
本轮样本得分 56 / 适用样本 57
查看详情

数据忠实度|本轮回归(证据子集)

本轮检查项
最终表格、图表和文字说明是否忠实反映可直接核验的 MCP / Tool 原始返回。
样本结果
适用样本实际得分之和,本轮为 56 分。
分母
具备完整 MCP 原始返回、答案表格且可逐字段映射的 57 条直接对账证据子集。
本轮折算
56 ÷ 57 × 100% = 98.2%。
回归口径
直接一致记 1 分,不一致记 0 分;缺少完整原始返回、日志截断或字段无法稳定映射的样本不补记为失败。
证据用途
最新连弩评分、同批 actual_output / actual_tools_call、人工订正记录;仅用于本轮回归佐证和版本间对比,不外推为能力绝对分数。数据忠实度另使用可直接对账的 MCP 证据子集。
主要失分场景
  • 对 ARPU、付费率、留存率等进行错误二次聚合
  • MCP 返回空值或未成熟,答案擅自填成具体数值
  • 答案表格漏值、改值或文字结论与数据矛盾
本轮问题示例

“查询前两周登录账号数、付费率、ARPU汇总数据,日期不要作为维度,只出一行数据。”——对不可直接累加或平均的付费率、ARPU进行了错误二次聚合。

图表数据一致 本轮回归
68.8%
本轮样本得分 75 / 适用样本 109
查看详情

图表数据一致|本轮回归

本轮检查项
Chart 与表格在指标、维度、数值、空值、百分比单位和键值映射上是否一致。
样本结果
适用样本实际得分之和,本轮为 75 分。
分母
存在可评价表图,或按拼报表产品规则应交付 Chart 的 109 条;2 条明确不适用、9 条无评估结论不计入。
本轮折算
75 ÷ 109 × 100% = 68.8%。
回归口径
表图评估器的 1、0 分按实际分值累计。日期升降序重排、百分比等价表示和中英文括号差异允许通过。
证据用途
最新连弩评分、同批 actual_output / actual_tools_call、人工订正记录;仅用于本轮回归佐证和版本间对比,不外推为能力绝对分数。数据忠实度另使用可直接对账的 MCP 证据子集。
主要失分场景
  • 应交付 Chart 但只返回表格或拒答
  • 率类指标的百分号、单位或数值换算不一致
  • 图表漏系列、维度角色错误或日期/分类映射错位
本轮问题示例

“帮我看最近7天新增账号、创角率、新用户付费率和付费金额,一张表就行。”——额外生成的图表只展示新增账号数和付费金额,漏掉两项率类指标。

应用功能验证前后端主流程基本可用图片和 Excel 上传解析、编辑发送、SSE 返回、表格图表展示及历史回显主流程已验证;相关结果不计入核心质量指标。

注意事项

以下是本次迭代不做支持的场景,可能存在查询或展示风险,可以按卡片中的方式拆解问题、补充条件或缩小单次查询范围规避。 问题跟踪

连续追问或中途改条件新建会话,一次性写全日期、维度、筛选和指标
日期、指标或统计口径没说清使用明确日期、标准指标名,并说明账号、设备或角色口径
一次想查的表、指标或筛选太多按业务主题拆成多次查询,再决定是否拼接
对比多个日期区间或筛选条件分别查询各组数据,并明确对齐周期与筛选作用域
日报、周报、月报等粒度混在一起分区展示并保留各自粒度,不强行共用一条横轴
要求合计、平均或自行计算比例优先使用目标粒度的标准指标,不从明细简单求和或平均

发布建议

条件通过,限定场景开放使用

当前版本在上述适用条件下整体可用。暂不稳定支持的场景及遗留问题可能影响部分查询的数据完整性、结果正确性或可读性。

  • 核心场景质量得分达到项目认可的使用标准。
  • Tool 选择、关键参数、报表拼接和 Agent 数据忠实度在限定条件下整体稳定。
  • 遗留问题可能影响部分场景的数据可信性,需结合影响范围控制开放方式。
  • 应用功能主流程正常可用。