拾穗数据工作室SQL 模型评测台

完成 · 2026年8月30日 00:23

运行 #10 评测报告

Sol,1 道题。综合得分为规则加权分,不是正确率。

比较条件存在差异:single_model。阅读模型间差距时必须保留这一前提。

逐题结果原始报告 JSON ↗事件 JSONL ↗
gpt-5.6-sol

Sol

综合得分 / 100
100.00
1题目数量
1每题尝试次数
0失败案例

样本边界:结论仅适用于此题库哈希、模型版本、适配器和参数快照。跨版本、跨运行稳定性需要独立复测。

得分与资源消耗

新 efficiency-v2 按业务结果正确题数归一;旧 efficiency-v1 保留综合得分 ÷ 100 的折算口径,两种指标不能混排。记录不完整时不估算单位正确题消耗。

指标Sol
综合得分
固定规则加权 / 100
100.00
Token / 归一单位19,472每得分折算题 · 1/1 题有记录
费用 / 归一单位
基于冻结价格;缺失不估
不可估算每得分折算题 · unavailable
生成耗时中位数
模型生成阶段
P95 —

分项得分

分项为加权得分,不是业务结果正确率。

题目维度Sol
窗口函数100.00

逐题结果

得分为全部计划尝试的均分,失败计入分母,未完成显示未知。展开可查看每次作答。

每品类收入前三商品top3_products_per_category100.00

Sol

全部 1 次计划作答 · 结果正确(页面派生)

A1 · 完成 · 100.00

汇总完成订单中各商品的净销售额,并使用 ROW_NUMBER 选出每个品类排名前三的商品;同额时 product_id 较小者优先。

结果正确(页面派生)

WITH product_revenue AS (
  SELECT
    p.category,
    p.product_id,
    p.product_name,
    SUM(oi.quantity * oi.unit_price - oi.discount_amount) AS net_revenue
  FROM fact_order_items AS oi
  JOIN fact_orders AS o
    ON oi.order_id = o.order_id
  JOIN dim_products AS p
    ON oi.product_id = p.product_id
  WHERE
    o.status = 'completed'
  GROUP BY
    p.category,
    p.product_id,
    p.product_name
), ranked_products AS (
  SELECT
    category,
    product_id,
    product_name,
    net_revenue,
    ROW_NUMBER() OVER (PARTITION BY category ORDER BY net_revenue DESC, product_id ASC) AS rank_no
  FROM product_revenue
)
SELECT
  category,
  product_id,
  product_name,
  net_revenue,
  rank_no
FROM ranked_products
WHERE
  rank_no <= 3
ORDER BY
  category ASC,
  rank_no ASC
查看 A1 完整证据