高级评测方法·12 分钟
金融大模型评测:从榜单到自建基准
QuantDev·2026-08-14
如何科学评测金融大模型:公开基准、幻觉率测试与自建业务评测集的完整方法。
为什么通用榜单不够用?
MMLU、C-Eval 这类通用榜单无法反映金融场景的真实能力。一个模型可以在常识推理上得分很高,却在计算债券久期、解读合并利润表时频繁出错。金融评测必须围绕你自己的任务构建:财报分析、合规问答、研报摘要、风险提示,每个任务的失败成本完全不同。
公开金融基准
目前可用的中文金融基准包括:FinEval(覆盖金融、经济、会计等学科考试题)、CFA 模拟题集、FinBen(综合金融能力评测)等。它们适合做初筛——快速淘汰明显不合格的模型,但题目静态、易被训练集污染,不能作为最终选型依据。
自建业务评测集
最佳实践是从真实业务中抽取 100-300 个样本,覆盖典型任务和边界情况:格式异常的财报、措辞模糊的条款、需要多步计算的问题。为每个样本准备标准答案或评分要点,用同一套 Prompt 对多个模型打分。评测集要定期更新,防止模型厂商针对公开样本过拟合。
幻觉率与数据可靠性
金融场景最致命的失败模式是幻觉——编造不存在的数据、法规条款或公司信息。评测时单独统计幻觉率:让模型输出带来源引用的答案,人工核对来源真实性。建议设置一票否决:关键数字无来源或来源错误率超过阈值的模型直接淘汰。
成本与延迟评测
在生产环境中,准确率之外还要评测单位成本和响应延迟:每千次调用的费用、P95 响应时间、长文档处理的上下文成本。建议绘制「准确率-成本」散点图,找到边际收益开始急剧下降的拐点,那就是性价比最优的模型档位。
这篇文章对你有帮助吗?在社区分享你的想法和问题。