北京大学学报(自然科学版) 第62卷 第2期 2026年3月
Acta Scientiarum Naturalium Universitatis Pekinensis, Vol. 62, No. 2 (Mar. 2026)
doi: 10.13209/j.0479-8023.2025.098
中国政法大学科研创新项目(24KYGH013)资助
收稿日期: 2025–03–04;
修回日期: 2025–08–05
摘要 为辅助审查案件量刑是否规范, 判断量刑属于畸轻、合理或畸重, 构建两个量刑规范性预测数据集, 同时提出一种基于多源知识聚合的量刑规范性预测模型。该模型利用大语言模型, 将刑事案件表示为知识图谱, 通过知识图谱生成案件的类案。为聚合刑法和类案知识, 在模型中设计多源注意力模块, 将该模块生成的多源特征与案件表示一起用于量刑规范性预测。量刑规范性预测对比实验结果表明, 所提模型的 F1 值高于其他对比模型。消融实验和案例分析表明, 刑法和类案对量刑规范性预测有重要辅助作用。
关键词 量刑规范性; 多源知识聚合; 类案检索; 注意力机制
法律判决预测是法律与人工智能结合的一项重要任务, 涉及罪名预测、法条预测和刑期预测[1]。在三项子任务中, 刑期预测属于回归任务, 难度较大。一些研究者针对刑期预测设计复杂的模型, 取得不错的预测结果[2–5]。然而, 对案件的裁决仍然需要权威的法官来执行, 因此量刑是否规范合理是司法机构面临的现实问题。例如, 表 1 中刑事案件 1 和刑事案件 2 的被告人均涉嫌非法制造枪支, 法官分别对其判处 36 个月和 24 个月有期徒刑。根据中华人民共和国刑法第一百二十五条“非法[制造、买卖、运输、邮寄、储存][枪支、弹药、爆炸物]”的法律条款, 36 个月的量刑是合理的正常的, 24个月的刑期则量刑畸轻。因此, 司法人员需要从海量案件中寻找量刑不合理的案件, 并予以矫正。
表1 两个刑事案件及其对应的刑法
Table 1 Two criminal cases and corresponding criminal laws

案件/刑法法条内容 刑事案件 1罪名是非法[制造、买卖、运输、邮寄、储存][枪支、弹药、爆炸物], 刑期是 36 个月。公诉机关指控, 2017 年 9 月, 被告人覃某在淘宝网上购买一支射钉枪及其他配件, 然后改装成枪支用于打猎。2017 年 10 月 20 日, 巴东县公安局将该网上涉枪线索移送至本县公安局, 随后本县公安局查获本案, 并缴获被告人非法制造的枪支 刑事案件 2罪名是非法[制造、买卖、运输、邮寄、储存][枪支、弹药、爆炸物], 刑期是 24 个月。公诉机关指控, 被告人刘某系装修的木工, 2014 年 10 月份, 被告人刘某在网上购买了 1 把射钉器及相关配件准备用于装修房屋, 因射钉器活塞在使用中损坏, 被告人刘某将其改装 刑法第一百二十五条非法制造、买卖、运输、邮寄、储存枪支、弹药、爆炸物的, 处三年以上十年以下有期徒刑; 情节严重的, 处十年以上有期徒刑、无期徒刑或者死刑
刑期预测是与量刑规范性相关的一项任务。Deng 等[6]发现大语言模型难以理解案件的复杂性, 也难以区分相似的指控, 为此引入受人类司法推理启发的询问–判别–预测推理框架, 此框架涉及分解案件事实、区分潜在罪名指控以及预测最终判决。Zhao 等[7]提出一种基于图神经网络的刑期预测方法, 利用多图融合机制, 全面、准确地整合法律条款信息。Gan 等[8]为利用法律案件中的数字来预测某些犯置指控的刑期, 使用提取的涉案金额来增强事实描述的表示, 这些涉案金额由预先训练的数字模型编码。尽管以上研究开展了大量实验, 但刑期预测的准确率并不高, 因此难以在现实场景中大规模地应用。同时, 虽然这些刑期预测方法与量刑规范性相关, 但并不是为量刑规范性预测问题专门设计的。
基于上述背景, 本文首次构建用于量刑规范性预测的大型中文数据集。通过修改合理的刑期, 生成量刑畸重和量刑畸轻的案件: 丢弃无期徒刑或死刑案件后, 将部分案件增加 50%的刑期, 将部分案件减少 50%的刑期。本文提出一种基于多源知识聚合的量刑规范性预测方法。该方法利用注意力网络从刑法和类案编码中动态地聚集特征, 通过注意力机制, 关联刑法和类案中与案件相关的知识内容, 为判断案件量刑是否规范提供依据。本文利用大语言模型, 为每个案件构建知识图谱, 并通过知识图谱生成类案。因此, 本文的语言模型(language model, LM)编码器能够高效地利用案件、刑法和类案的特征。最后, 通过与基准模型的对比实验来测试本文模型在量刑规范性预测问题上的表现。
法律人工智能是利用人工智能技术解决法律领域问题的创新手段, 为法律实践提供新的工具, 法律人工智能涵盖多个方向。Yue 等[4]通过探索犯罪情节, 提出一个具有情节感知能力的法律判决预测框架, 利用中间子任务的预测结果将案件事实描述分解成不同的情节, 利用这些情节来产生其他子任务的结果。Han 等[9]构建专注于提高法院工作效率和进行法律援助的法律助理自动化软件, 利用结构化表示, 使法律和案例更易于浏览和理解, 引入基于决策树的判决, 使整个判决过程显而可见。为正确理解和快速处理冗长的法律文件, Jain 等[10]提出一种新的句子评分方法 DCESu-mm, 包括基于有监督的句子级摘要相关性预测以及基于无监督聚类的文档级分数增强, 利用评分, 从法律文档中识别出更具信息性的句子。伴随大语言模型的发展, 法律人工智能诞生许多新的应用。例如, Shu 等[11]使用上下文学习和高级信息检索方法等技术, 设计一种面向美国法律领域的多任务法律大语言模型 Law-LLM, 在零样本和少样本场景中的表现优于基准模型。Xie 等[12]提出一个基于大型语言模型的中文法律咨询系统 DeliLaw, 用户可以在该系统中以对话模式进行法律问题专业咨询、搜索法律文章和相关裁判案例等。以上研究在法律人工智能领域取得大量重要进展, 但尚未对法律量刑规范性问题展开研究。
类案检索通过智能化检索方法, 从大规模的案例库中找到与特定案件的犯罪事实、法律关系或裁判结果相似的案例。类案检索的目的是辅助法律工作者在处理案件时, 借鉴相似案例中的法律适用逻辑和裁判规则来提高判决的公平性和统一性。许多研究者关注类案检索问题并提出相应解决方法。Zhang 等[13]通过深度融合法律案件中的实体和事件信息并结合异构图的多层特征, 构建案件特征的全面表示, 提高了法律案例检索的准确性和效率。Ma 等[14]提出一个结构化法律案例检索框架, 利用法律文件的组织模式, 将案例文件拆分为多个片段分别进行处理, 同时预先计算刑事指控之间的相似性并将其作为外部结构信息, 增强对相关案件的识别能力。为结合法律专家知识, Deng 等[15]提出一种基于大型语言模型的法律知识引导的案例重构方法KELLER, 用于有效且可解释的法律案例检索。
注意力机制可在神经网络中利用权重大小来模仿人类的认知注意力, 过滤掉不相关或无用的信息, 并专注于重要的目标或任务。注意力机制能带来显著的效果提升, 广泛应用于语音识别、图像融合和文档问答等领域[16–17]。Udeh 等[18]将 ECA-Net 的注意力机制集成到 ShuffleNet V2 模型中, 增强对重要特征的提取, 放大与语音中传达的情绪状态密切相关的特征的表达, 同时抑制不相关的特征。Wang等[19]提出一种基于掩模注意机制的通用图像融合方法, 在预训练阶段生成粗粒度掩码图, 并利用掩码图改进掩码自编码器和掩码注意机制。在图像融合阶段, 借助掩模自编码器改变随机掩模的过程, 丢弃源图像间的冗余特征。为解决无监督长文档问答问题, Nie 等[20]提出 Atten-Walker 模型, 借助预训练长文档模型的注意力图谱, 通过注意力游走算法, 将相关的文本跨度链接在一起, 因此, 模型能够聚合和生成具有长距离依赖性的答案, 构建长文档问答对。此外, 注意力机制也频繁融入信息融合和内容推荐等任务中。
在法律与人工智能领域, 尚无量刑规范性相关研究, 没有公开的中文数据集。本文基于两个公开的法律数据集, 构建适用于量刑规范性的数据集。
本文选用 CAIL2018 和 HRN2023 两个公开的法律数据集。CAIL2018 来自中国裁判文书网公开的刑事法律文书, 每个案件涉及案件事实和单个被告人对应的罪名、法条和刑期。HRN2023 来自中国裁判文书网的多被告人刑事法律文书, 由专家标注案件中每个被告应判的罪名、法条和刑期。
本文认为两个数据集中每个被告的判决均是公正合理的, 在此基础上, 将 CAIL2018 和 HRN2023数据集的所有被告平均分成三部分: 第一部分被告人的刑期保持不变, 第二部分被告人的刑期在原刑期基础上增加 50%, 第三部分被告人的刑期在原刑期的基础上减少 50%。由此, 生成量刑正常、量刑畸重和量刑畸轻的数据集。所有的刑期以月份为计量单位, 且进行四舍五入取整。因无期徒刑或死刑无法转换为月份, 因此丢弃对应的数据。
在两个数据集中, 我们将每个被告的罪名、刑期和案件事实拼接到一起。考虑到案件事实可能过长, 如果案件事实在前, 罪名和刑期容易在截断时被舍弃, 因此将案件事实置于最后。数据标签设置为 0, 1 和 2 共 3 种, 分别表示量刑畸轻、量刑正常和量刑畸重。将构建的两个数据集命名为 CAIL2018-SS 和 HRN2023-SS, 表 2 列出部分数据样例。需要注意的是, HRN2023 原始数据集是面向多个被告人的刑事案件, 为将其转换为量刑规范性数据集, 本文在每个案件的开头指明具体被告人。
如表 3 所示, 基于 CAIL2018-SS 的量刑规范性数据集有 192 项罪名, 基于 HRN2023-SS 的量刑规范性数据集有 30 项罪名。
本文将量刑规范性预测问题形式化, 并提出基于多源知识聚合的整体框架。该框架通过多源注意力机制, 融合案件对应的刑法规定和相似案件, 并通过分类模型判断量刑是否合理规范。
给定一个刑事案件集合
, 每个刑事案件 si 是案件事实、罪名和刑期的综合描述。量刑规范性问题根据刑事案件描述
、该案件对应的刑法 cl 和类案集合
, 预测量刑对应的类别标签为
, 类别 0, 1 和 2 分别表示量刑畸轻、量刑正常和量刑畸重。通过模型 M, 预测刑事案件 si 的量刑类别
。
表2 量刑规范性预测的数据样例
Table 2 Sample data for sentencing normativity prediction

数据集刑事案件标签 CAIL2018-SS罪名是故意杀人, 刑期是 60 个月。宁德市蕉城区人民检察院指控, 2014 年 5 月 27 日凌晨 1 时许, 被告人黄 2 某持水果刀捅刺被害人林某甲胸部数刀。经宁德市公安局刑事科学研究所法医学鉴定, 被害人林某甲的伤情属重伤二级, 九级伤残。……0 罪名是破坏电力设备, 刑期是 36 个月。东阳市人民检察院指控, 2015 年 9 月底至 10 月 19 日期间, 被告人位某六次窜至本市白云街道江滨南街歌山画水公园内, 趁夜间公园无人之机, 窃得已铺设好的价值人民币 8910 元的中策牌电缆线 550 米。……1 罪名是盗窃, 刑期是 33 个月。经审理查明, 2015 年 1 月 19 日 13 时许, 被告人兰某某在瑞丽市下弄安村 X 号木材加工厂仓库门口, 将被害人董某某停放于此的一辆黄色万虎牌 WH250ZH-2B 型摩托车盗走。经鉴定, 被盗摩托车价值人民币 15300 元。……2 HRN2023-SS被告是被告 A, 罪名是贩卖毒品罪, 刑期是 90 个月。[被告 A],[被告 B]走私、贩卖、运输、xxx 罪一审刑事判决书<LOC>延安市中级人民法院刑事判决书(2018)陕 06 刑初 34 号公诉机关<LOC>延安市人民检察院。被告人[被告 A], 男, ……0 被告是被告 A, 罪名是开设赌场罪, 刑期是 10 个月。<LOC>人民法院刑事判决书(2019)浙 1081 刑初 1895 号公诉机关<LOC>人民检察院。被告人[被告 A], 男, 1975 年 1 月 28 日出生于<LOC>, 汉族, 小学文化, 居民, 住<LOC>。……1 被告是被告 B, 罪名是盗窃罪, 刑期是 54 个月。吉林省<LOC>人民法院刑事判决书(2018)吉 0802 刑初 278 号公诉机关吉林省<LOC>人民检察院。被告人[被告 B], 男, 1988 年 7 月 23 日出生, 汉族, 小学文化, 无职业, ……2
表3 基于 CAIL2018-SS 的量刑规范性数据集统计结果
Table 3 Statistics based on the CAIL2018-SS sentencing normativity dataset

量刑情况CAIL2018-SS 数据集HRN2023-SS数据集 训练集验证集测试集总数训练集验证集测试集总数 量刑畸轻 36911 4861 9412 51184197212542249424757 量刑正常 36911 4861 9412 51184197212542249424757 量刑畸重 36913 4862 9413 51188197212542249624759 总数1107351458428237153556591637626748474273
对刑事案件被告人进行审判时, 法官需要依据《中华人民共和国刑法》和往年相似案件做出最终判决。受此过程的启发, 本文以刑法和类案作为辅助知识, 面向已量刑的刑事案件, 判断其刑期是否合理、规范。本文构建的量刑规范性预测模型框架如图 1 所示。针对每一个刑事案件, 该模型通过法条检索其对应的刑法, 同时基于知识图谱, 检索该案件的类案。刑事案件、刑法和类案通过一个语言模型编码器进行编码, 生成案件特征表示、刑法特征表示和类案特征表示。采用融合刑法和类案的多源注意力算法, 对案件特征表示进行更新, 生成高层语义表示。基于高层语义表示和案件特征, 通过一个分类器实现量刑规范性的预测。
类案在法律中起到规范裁判标准、促进公正和统一法律适用的重要作用。通过参考相似案件的判决, 法官可以更好地把握法律条款的解释, 确保在同类案件中有一致的裁判尺度, 实现“同案同判”。借鉴此方法, 当前许多法律判决预测研究通过借助类案来提高判决预测的精准性[3,21]。本文设计的模型通过参考案件的类案及其判决, 用于判断案件的量刑是否合理。
具体地, 本文采用基于知识图谱的类案检索方法, 将每个案件构建为一个独立的知识图谱, 并通过度量知识图谱间的相似度来表示案件之间的相似度。为构建高质量的案件知识图谱, 本文选用信息抽取能力较强的 gpt-4o-mini 大语言模型(large lan- guage model, LLM), 通过设置 LLM 提示词, 抽取知识图谱三元组。例如, 对图 2(a)所示案件, 通过LLM 提示词和 LLM 生成的案件知识图谱三元组如图 2(b)和(c)所示, 每个三元组由头实体、关系和尾实体构成。
案件
和类案
的转换方式如下:

图1 基于多源知识聚合的量刑规范性预测模型框架
Fig. 1 Framework for sentencing normativity prediction model based on multi-source knowledge aggregation
, (1)
, (2)
其中, Q 为类案的数量。为计算案件
与其第 q 个类案
的相似性, 本文将案件知识图谱中每个三元组的头实体、关系和尾实体视为一个整体, 通过两个案件三元组之间的平均相似度, 衡量它们的整体相似度。
如图 3 所示, 左侧的
与右侧的
是两个案件的三元组表示, 二者的相似度计算方法如下:
, (3)
(4)
其中,
和
分别代表
和
的头实体、关系或尾实体;
为指示函数, 当
时为 0, 其余情况为 1。本文应用 textdistance①https://github.com/life4/textdistance中基于token 的重叠系数方法来计算
和
的相似度。最后, 案件
与类案
的相似度由所有三元组对的相似度组合而成:
。 (5)对于特定案件 si, 本文类案检索方法计算
与所有训练数据案件的相似度, 然后将其从大到小排序, 选择前
个刑事案件作为 si 的类案。用 N表示训练数据案件数量, L表示每个训练数据案件三元组的平均 token 数, M表示特定案件对应的三元组数量,
表示训练数据对应的平均三元组数量, 则相似度的计算次数为 N, 相似度的计算复杂度为O(NLM
), 排序的计算复杂度为 O(NlogN), 最终计算的复杂度为 O(NLM
+NlogN)。

图2 案件示例、LLM 提示词以及 LLM 生成的案件知识图谱三元组
Fig. 2 Case example, LLM prompts and case knowledge graph triples generated by LLM

图3 基于知识图谱的案件相似度计算
Fig. 3 Case similarity calculation based on knowledge graph
注意力机制能够通过选择性聚焦和信息融合来提高模型的表达能力, 使模型在应对复杂信息时, 更有针对性地提取有效特征。因此, 本文利用注意力机制, 将刑事案件的特征与刑法规定及相似案件的特征相结合。首先, 语言模型从刑事案件、刑法和类案中提取语言特征, 编码过程如下:
, (6)
, (7)
, (8)
其中, L 表示序列长度, H 表示特征维度,
是第 j个类案的编码表示。在设计多源注意力时, 本文将刑事案件的编码表示与其对应的刑法编码表示和每个类案的编码表示分别计算注意力。以刑法注意力计算为例, 其计算方法为
(9)
(10)
(11)
其中,
为通过注意力机制在刑法中寻找的案件关键内容表示。对于每个类案
, 模型也采用以上方法计算其面向 Rsi 的关键内容表示, 记录为
。
为从多个来源聚合案件的相关知识, 本文模型将通过注意力机制获取的刑法关键内容表示和类案关键内容表示拼接到一起, 再经过最大池化进行降维, 提取最显著特征:
(12)其中, “+”表示拼接操作, MaP 表示最大池化操作。需要注意的是, 模型在两个维度上连续进行最大池化, 进而得到一维的多源特征。为对输入案件进行量刑规范性预测, 模型将 T 与案件的聚合表示拼接后, 通过线性变换对案件进行量刑规范性预测:
, (13)
, (14)其中,
是案件整体的聚合表示, 由模型的 LM 编码器生成; W 是可学习参数矩阵, 其维度大小是(2H, 3)。
本文模型根据刑事案件训练集进行训练学习。为使模型对案件的量刑预测输出与真实情况相符, 采用以下交叉熵损失函数衡量模型预测与真实标签的差异:
, (15)其中, C 是类别总数,
是第 c 类的真实标签,
表示模型预测案件类别为第 i 类的分数。
本文选用两大类代表模型进行对比实验, 验证本文模型中刑法和类案的作用。实验设置不同的量刑偏差, 研究偏差大小对量刑规范性预测的影响。
在对比实验中, 本文选用两类模型: 一类是商用大语言模型, 另一类是自训练语言模型。本文模型属于自训练语言模型。对于每种自训练语言模型, 分别使用 CAIL2018-SS 和 HRN2023-SS 数据集进行训练和测试。对于每种商用大语言模型, 无需进行训练, 直接利用模型 API 接口进行测试。本文选择的其他自训练语言模型如下。
1 )FastText[22]是一种简单且高效的文本分类模型, 通过引入 n-grams 特征表示, 捕捉短语级的上
下文信息, 弥补词袋模型的不足。同时, 模型中分层的 softmax 设计显著地加速大规模数据集的训练过程。该模型的总参数量是 152465741。
2 )TextCNN[23]基于卷积神经网络, 在预训练词向量的基础上进行训练, 并用于句子级分类任务。这种方法证明, 即使是简单的 CNN 模型, 结合词嵌入初始化, 也能在情感分析、问答主题分类等任务中达到或超越传统方法。这个模型的总参数量是1417813。
3 )TextRNN[24]利用循环神经网络(如 LSTM), 对输入序列进行建模, 提取句子的上下文表示。模型利用底层的共享循环神经网络提取通用特征, 顶部的任务特定层学习每个任务的独特表示, 结合多任务学习, 提升文本分类的性能。该模型的总参数量是 1686869。
4 )Transformer[25]是一种完全基于注意力机制的新模型, 其自注意力机制能直接捕获序列中不同位置之间的依赖关系, 多头注意力机制能够在不同子空间中并行计算注意力分布, 解决长距离依赖和并行化问题。该模型的总参数量是 3934777。
5 )BERT[26]模型通过双向 Transformer 编码器, 捕获句子中每个词的上下文信息, 从而提供更丰富的语义表示。其掩码语言模型通过预测这些词的概率分布进行训练, 帮助学习深层上下文关系。其下一句预测任务判断两段文本是否为连续句子, 进而增强模型对句子间关系的理解。该模型的总参数量是102275338。
6 )BERT+AGN[27]模型提出一种自适应门网络, 通过变分组件对文本统计特征进行编码, 并利用阀门机制合并信息, 阀门根据决策中语义特征的置信度调整信息流入分类器, 进而训练具有鲁棒性的文本分类器。该模型的总参数量是 102354058。
本文采用的商用大语言模型如下。
1 )Baichuan 是百川智能公司开发的一系列大模型, 包括如 Baichuan-7B 和 Baichuan-13B 等不同参数规模的大模型。其二代模型 Baichuan2-7B[28]在中文基准数据集 CMMLU 体现的中文水平超越 LLa-MA2 13B。
2 )DeepSeek 是深度求索公司研发的大模型, 其开源第三代 MoE 大模型 DeepSeek-V3[29]的性能与GPT-4o 相近, 但价格远低于 GPT-4o。
3 )GLM 是智谱 AI 推出的一系列大型预训练语言模型, 其最新一代大模型 GLM-4[30]原生支持问答、联网查询、绘图和图像识别等多种操作, 实现根据用户意图自动理解并规划复杂指令, 自由调用网页浏览器、代码解释器和多模态文生图大模型。
4 )GPT 是由 OpenAI 开发的一系列语言生成模型, 其最新一代模型 GPT-4[31]支持处理多模态输入, 包括文本、图像和音频, 应用范围更广。该模型在各种专业和学术测试中表现出人类水平(例如能够模拟律师考试)。
本文实验的运行环境为 Python 3.12 的 Ubuntu 20.04 系统, 深度学习框架为 PyTorch 2.5, 显卡为NVIDIA RTX A6000。为保证实验对比的公正, 在自训练大语言模型中, 统一将批大小设置为 64, 学习率设置为 0.0005, 文本序列长度设置为 512, 优化器为 Adam, dropout 设置为 0.1。本文模型选用的LM 编码器为 BERT, 对应的总参数量是 102275338, 类案选用的数量为前 3 个。LM 利用式(6)~(8)对案件、刑法和类案进行编码, 通过式(9)~(11)计算注意力和关键内容表示。本文采用 Baichuan2-Turbo, DeepSeek-V3, GLM-4-flash 和 GPT-4o-mini 等通用商用大语言模型, 这些模型价格低, 性能优良, 适用于本文面向大规模数据集的实验。将对比模型中大模型的提示词设计为“犯罪记录: <criminal case>根据以上被告人、罪名、刑期和犯罪事实描述, 判断量刑是否规范; 量刑分 3 种情况, 0 代表量刑畸轻, 1 代表量刑正常, 2 代表量刑畸重; 仅输出量刑结果, 结果为 0, 1 或 2”。其中, <criminal case>代表数据集中的某一具体案件。同时, 除所有对比模型外, 本文还增加一个对量刑规范性预测的随机猜测实验, 用来验证对比模型是否优于随机猜测。本文采用宏平均精确率、宏平均召回率和宏平均 F1 值等评估指标, 对模型的性能进行衡量和比较。
表 4 展示本文模型与对比模型在 CAIL2018-SS和 HRN2023-SS 上的量刑规范性预测结果。在前 6个自训练语言模型中, BERT+AGN 模型在两个数据集上的预测结果均最好, FastText 模型的预测效果最差, 多数模型的 F1 值可达到 70%以上。4 个商用大语言模型的预测结果较差, 即使是 F1 值最高的Baichuan 模型, 也没有随机猜测的效果好。这些模型的预测结果多数为 1, 即量刑正常, 说明商用大语言模型缺乏刑法和类案知识, 无法根据刑事案件及其刑期判断当前量刑结果是否合理。
表4 CAIL2018-SS 和 HRN2023-SS 数据集量刑规范性预测结果的比较分析
Table 4 Comparative analysis of sentencing normativity prediction results between CAIL2018-SS and HRN2023-SS datasets

模型CAIL2018-SSHRN2023-SS 精确率/%召回率/%F1/%精确率/%召回率/%F1/% 自训练模型FastText51.1250.8750.8255.1655.3255.2 TextCNN65.1764.9665.0268.0868.1768.11 TextRNN72.8772.9372.8473.2273.3873.27 Transformer74.6874.7374.6575.6175.875.66 BERT75.5575.675.5276.7476.9476.78 BERT+AGN76.6276.6676.5878.1278.3378.17 商用模型Baichuan39.2932.9522.5023.3633.5223.92 Deepseek64.0833.7118.3411.0033.3316.54 GLM59.0033.4418.0223.6933.4618.03 GPT48.5933.6818.5540.5633.5217.51 随机猜测33.2233.2233.2232.5532.5532.55 本文模型77.7377.5977.5779.0979.2979.13
说明: 粗体数字为性能最优。
此外, 自训练语言模型对 HRN2023-SS 数据集的量刑规范性预测结果比 CAIL2018-SS 数据集高, 主要原因是自训练语言模型能够将被告人与其犯罪情节关联, 并区分不同的被告人。不同商用大语言模型在两个量刑规范性任务中预测效果有差异, 例如 Deepseek 和 GPT 对 HRN2023-SS 数据集的量刑规范性预测结果较低, 原因是这两个模型难以区分多被告人的犯罪情节, 进而产生混淆。相比其他模型, 本文模型在两个数据集上的预测结果最好, F1值分别达到 77.57%和 79.13%, 说明刑法和类案知识对刑事案件量刑是否规范具有重要参考价值, 模型能够利用多源注意力将这些知识聚合到分类模块, 实现量刑规范性的预测。
为探究刑法和类案在模型中的关键作用, 本文设计 3 个消融实验, 一是取消模型对刑法知识的参考, 二是取消模型对类案知识的参考, 三是刑法和类案两类知识参考均取消。表 5 展示 3 个消融实验的结果。可以看出, 3 种情况对应的 F1 值都比完整模型低, 说明聚合刑法和类案知识对量刑规范性预测有帮助。此外, 与完整模型相比, 在 CAIL2018-SS 数据集上, 无刑法和无类案的 F1 值分别下降0.8%和 1.12%; 在 HRN2023-SS 数据集上, 无刑法和无类案的 F1 值分别下降 0.68%和 1.08%, 表明类案比刑法对量刑规范性的帮助更大。我们认为原因是类案中的刑期较为显性且清晰, 而刑法中对刑期的范围描述比较模糊。
在构建量刑规范性数据集时, 本文设置的量刑偏差为 50%的相对误差。然而, 在真实案件中, 量刑偏差可大可小。因此, 我们将量刑偏差设置为不同大小的相对误差, 并测试模型性能的变化。以CAIL2018-SS 量刑规范性数据集为例, 量刑偏差设置为 10%, 30%, 50%, 70%和 90%。量刑偏差对模型的性能影响如图 4 所示。如果将量刑偏差由 50%分别改为 30%和 10%, 则 F1 值由 77.57%分别下降为70.56%和 65.48%, 表明量刑偏差越小, 模型对量刑结果的识别难度越大。原因是量刑正常案件的刑期与量刑存在偏差案件的刑期十分接近, 区分的难度校大。与此相反, 当量刑偏差由 50%分别改为 70%和 90%时, 模型能够相对容易地识别出案件量刑是否存在偏差以及量刑畸轻或畸重, 因此模型的 F1值出现逐步上升的现象。如果数据集中存在量刑偏差大小不同的案件, 本文模型仍然能够对量刑规范性做出预测, 且预测量刑偏差小的案件的正确率低, 而预测量刑偏差大的案件的正确率高。
表5 刑法和类案知识对量刑规范性预测的影响
Table 5 Impact of criminal law and similar cases on sentencing normativity prediction

模型CAIL2018-SSHRN2023-SS 精确率/%召回率/%F1/%精确率/%召回率/%F1/% 完整模型77.7377.5977.5779.0979.2979.13 无刑法知识76.8176.7476.7778.4178.6178.45 无类案知识76.7576.6276.4578.0178.2178.05 无刑法和类案知识75.5575.675.5277.1977.3977.23
说明: 无刑法和类案的模型为表4中的BERT模型。
在 CAIL2018-SS 和 HRN2023-SS 上, 对类案的数量进行实验对比, 结果如图 5 所示。当刑事案件参考的类案数量为 0 时, 模型不使用类案知识, 量刑规范预测的 F1 值最低。随着参考类案数量增多, F1 值逐渐增大, 表明类案知识对量刑规范性预测有帮助。然而, 类案数量超过 3 时, F1 值反而出现下降的趋势。原因是过多类案提供的不同刑期给模型造成一定的干扰, 导致量刑规范性预测能力下降。因此, 模型参考的类案数量并非越多越优。

图4 量刑偏差的性能影响
Fig. 4 Performance impact of sentencing bias

图5 刑事案件参考类案数量的性能影响
Fig. 5 Performance impact of the number of reference cases in criminal cases
为了检验本文方法的有效性, 表 6 列出 CAIL-2018-SS 数据集中某测试案件以及该案件对应的刑法、类案和预测结果。在构建数据集时, 将测试案件的刑期由 36 个月改为 54 个月, 因此其类别标签为 2, 即量刑过重。BERT 模型和 BERT+AGN 模型对测试案件的量刑规范性预测结果均为 1, 即认为54 个月的刑期是正常的。根据“开设赌场”对应的“刑法第三百零三条: 开设赌场的, 处三年以下有期徒刑、拘役或者管制, 并处罚金; 情节严重的处三年以上十年以下有期徒刑, 并处罚金”, 此类案件被告人的刑期在 3 年以下。同时, 测试案件的 3 个类案均为“开设赌场”类犯罪, 被告人的刑期为 34 个月时量刑正常, 为 4 个月时量刑畸轻, 为 54 个月时量刑畸重。因此, 本文模型通过刑法规定和类案参考这两项知识源, 能够确定测试案件的量刑轻重。
本文构建首个适用于量刑规范性的数据集, 提出一种基于多源知识聚合的量刑规范性预测模型。该模型利用大语言模型将刑事案件表示为知识图谱, 并通过知识图谱检索类案。为聚合刑法和类案知识, 本文模型设计多源注意力模块, 该模块生成的多源特征与案件表示一起用于量刑规范性预测。通过与多个模型的实验对比, 证明了本文模型的有效性。进一步的消融实验结果表明, 刑法和类案均对量刑规范性预测有帮助。对量刑偏差和类案数量的实验结果表明, 量刑偏差越小, 模型对量刑结果的识别难度越大, 类案数量对量刑规范性预测有帮助, 但并非越多越优。
本文研究的不足之处是只对两个刑事案件数据集的量刑规范性预测展开研究, 尚未在民事和行政等类型案件上进行验证。未来, 本文模型将应用于检察院等司法机构, 辅助司法人员完成案件审查和判决预测等工作, 进一步验证模型在实际司法应用场景中的适用性与稳定性。
表6 CAIL2018-SS 数据集中某一测试案件和该案件对应的刑法、类案和预测结果
Table 6 A test case in the CAIL2018-SS dataset along with its corresponding criminal law, similar cases, and prediction results

案件或模型内容类别标签 测试案件罪名是开设赌场, 刑期是54个月。岑溪市人民检察院指控, 2014年6月份, 被告人刘某在岑溪市商贸城后街经营新动力游戏机室, 利用具有赌博功能、共有73个机位的游戏机9套(台), 每天招揽参赌人员10至30人进行赌博, 直至同月25日被公安机关查处2 (量刑畸重) 类案1罪名是开设赌场, 刑期是34个月。安徽省南陵县人民检察院指控: 2015年5月中旬至6月1日, 被告人韩某租用南陵县××村自然村一民宅, 以提供场所、桌椅、赌具、饮食的方式××, 组织他人以推“二八杠”的方式进行赌博并抽头渔利。每天参赌人员十余人, 韩某从中抽头渔利约8000元。2015年6月1日, 被告人韩某开设的赌场被公安民警查禁, 韩某被现场抓获归案; 公安民警在现场查获赌具牌九一副、赃款2250元1 (量刑正常) 类案2罪名是开设赌场, 刑期是4个月。汕头市潮阳区人民检察院指控, 2015年3月份至同年11月11日期间, 被告人邓某在其位于潮阳区××镇××村一片的出租屋里放置4台麻将机供人赌博, 并以每张麻将桌抽水40元的方式进行牟利。2015年11月11日13时许, 公安机关对该出租屋进行检查, 现场抓获被告人邓某及参赌人员李某、易某、肖某、袁某, 查扣麻将机4台、麻将牌1副、赌资1020元。0 (量刑畸轻) 类案3罪名是开设赌场, 刑期是54个月。经审理查明, 2014年7月初, 被告人蔡某某购买“三色凤凰”、“疯狂鲨鱼”游戏机各一台, 共十六机位。2014年7月20日, 蔡某某以每月1000元的租金向林某某转租位于富顺县××镇××小区门口的门面一间, 并将事前购买的二台游戏机放置在内开设游戏室, 聘请胡某某、杨某某、邱某某为游戏室工作人员, 分别负责上下分、查分2 (量刑畸重) BERT1 (量刑正常) BERT+AGN1 (量刑正常) 本文模型2 (量刑畸重)
参考文献
[1] Xu Nuo, Wang Pinghui, Chen Long, et al. Distinguish confusing law articles for legal judgment prediction // Proceedings of the 58th Annual Meeting of the Asso-ciation for Computational Linguistics. Online Mee-ting 2020: 3086–3095
[2] Dong Qian, Niu Shuzi. Legal judgment prediction via relational learning // International ACM SIGIR Confe-rence on Research and Development in Information Retrieval. Online Meeting, 2021: 983–992
[3] Wu Yiquan, Zhou Siying, Liu Yifei, et al. Precedent-enhanced legal judgment prediction with LLM and domain-model collaboration // Conference on Empiri-cal Methods in Natural Language Processing. Singa-pore, 2023: 12060–12075
[4] Yue Linan, Liu Qi, Jin Binbin, et al. A circumstance-aware neural framework for explainable legal judg-ment prediction. IEEE Transactions on Knowledge and Data Engineering, 2024, 36(11): 5453–5467
[5] 张春云, 曲浩, 崔超然, 等. 基于过程监督的序列多任务法律判决预测方法. 计算机科学, 2021, 48 (3): 227–232
[6] Deng Chenlong, Mao Kelong, Zhang Yuyao, et al. Enabling discriminative reasoning in LLMs for legal judgment prediction // Findings of the Association for Computational Linguistics: EMNLP. Miami, 2024: 784–796
[7] Zhao Qihui, Gao Tianhan, Guo Nan. LA-MGFM: a le-gal judgment prediction method via sememe-enhanced graph neural networks and multi-graph fusion mecha-nism. Information Processing and Management, 2023, 60(5): 103455
[8] Gan Leilei, Li Baokui, Kuang Kun, et al. Exploiting contrastive learning and numerical evidence for confu-sing legal judgment prediction // Findings of the Asso-ciation for Computational Linguistics: EMNLP. Singa-pore, 2023: 12174–12185
[9] Han Wenjuan, Shen Jiaxin, Liu Yanyao, et al. Legal-Asst: human-centered and AI-empowered machine to enhance court productivity and legal assistance. Infor-mation Sciences, 2024, 679: 121052
[10] Jain D, Borah M D, Biswas A. A sentence is known by the company it keeps: improving legal document sum-marization using deep clustering. Artificial Intelligen-ce and Law, 2024, 32(1): 165–200
[11] Shu Dong, Zhao Haoran, Liu Xukun, et al. LawLLM: law large language model for the US legal system // The 33rd ACM International Conference on Informa-tion and Knowledge Management. Boise, 2024: 4882–4889
[12] Xie Nan, Bai Yuelin, Gao Hengyuan, et al. DeliLaw: a chinese legal counselling system based on a large language model // The 33rd ACM International Confe-rence on Information and Knowledge Management. Boise, 2024: 5299–5303
[13] Zhang Yuxin, Zhai Songlin, Meng Yuan, et al. Event is more valuable than you think: improving the similar legal case retrieval via event knowledge. Information Processing and Management, 2024, 61(4): 103729
[14] Ma Yixiao, Wu Yueyue, Ai Qingyao, et al. Incorpora-ting structural information into legal case retrieval. ACM Transactions on Information Systems, 2024, 42(2): 40: 1–40: 28
[15] Deng Chenlong, Mao Kelong, Dou Zhicheng. Learning interpretable legal case retrieval via knowledge-guided case reformulation // Proceedings of the 2024 Confe-rence on Empirical Methods in Natural Language Pro-cessing. Miami, 2024: 1253–1265
[16] 杨育婷, 李玲玲, 刘旭, 等. 基于多尺度–多方向Transformer的图像识别. 计算机学报, 2025, 48(2): 249–265
[17] 魏康康, 骆伟祺, 刘明林. 基于中心差分卷积和注意力的空域彩色图像隐写分析. 软件学报, 2024, 35(12): 5671–5686
[18] Udeh C P, Chen L F, Du S, et al. Improved ShuffleNet V2 network with attention for speech emotion recog-nition. Information Sciences, 2025, 689: 121488
[19] Wang Xiangxiang, Fang Lixing, Zhao Junli, et al. MMAE: a universal image fusion method via mask attention mechanism. Pattern Recognition, 2025, 158: 111041
[20] Nie Yuxiang, Huang Heyan, Wei Wei, et al. Atten-Walker: unsupervised long-document question answe-ring via attention-based graph walking // Findings of the Association for Computational Linguistics. Toron-to, 2023: 13650–13663
[21] Zhang Han, Dou Zhicheng, Zhu Yutao, et al. Contra-stive learning for legal judgment prediction. ACM Transactions on Information Systems, 2023, 41(4): 1–25
[22] Joulin A, Grave E, Bojanowski P, et al. Bag of tricks for efficient text classification // Proceedings of the 15th Conference of the European Chapter of the Association for Computational Linguistics. Valencia, 2017: 427–431
[23] Kim Y. Convolutional neural networks for sentence classification // The 2014 Conference on Empirical Methods in Natural Language Processing. Doha, 2014: 1746–1751
[24] Liu Pengfei, Qiu Xipeng, Huang Xuanjing. Recurrent neural network for text classification with multi-task learning // The Twenty-Fifth International Joint Con-ference on Artificial Intelligence. New York, 2016: 2873–2879
[25] Vaswani A, Shazeer N, Parmar N, et al. Attention is all you need // Advances in Neural Information Processing Systems. Long Beach, 2017: 5998–6008
[26] Devlin J, Chang Mingwei, Lee K, et al. BERT: pre-training of deep bidirectional transformers for langua-ge understanding // The 2019 Conference of the North American Chapter of the Association for Computa-tional Linguistics. Minneapolis, 2019: 4171–4186
[27] Li Xianming, Li Zongxi, Xie Haoran, et al. Merging statistical feature via adaptive gate for improved text classification // Thirty-Fifth AAAI Conference on Arti-ficial Intelligence. Vancouver, 2021: 13288–13296
[28] Yang Aiyuan, Xiao Bin, Wang Bingning, et al. Bai-chuan 2: open large-scale language models [EB/OL]. (2023–09–19) [2025–09–05]. https://arxiv.org/abs/23 09.10305
[29] Liu Aixin, Feng Bei, Xue Bing, et al. DeepSeek-V3 technical report [EB/OL]. (2024–12–27) [2025–09–05]. https://arxiv.org/abs/2412.19437
[30] Zeng Aohan, Xu Bin, Wang Bowen, et al. ChatGLM: a family of large language models from GLM-130B to GLM-4 all tools [EB/OL]. (2024–06–18) [2025–09–05]. https://arxiv.org/abs/2406.12793
[31] OpenAI, Achiam J, Adler S, et al. GPT-4 technical report [EB/OL]. (2023–03–15) [2025–09–05]. https:// arxiv.org/abs/2303.08774
A Sentencing Normativity Prediction Method Based on Multi-Source Knowledge Aggregation
Abstract To assist in reviewing the standardization of sentencing in cases and determining whether a sentence is disproportionately light, reasonable, or disproportionately heavy, two datasets for predicting sentencing standar-dization are constructed, and a multi-source knowledge aggregation-based model for sentencing standardization prediction is proposed. The model employs a large language model to represent criminal cases as knowledge graphs, from which similar cases are generated. To integrate knowledge from criminal law and similar cases, a multi-source attention module is designed in the model. The multi-source features generated by this module, together with case representations, are used for sentencing standardization prediction. Comparative experimental results on sentencing standardization prediction show that the F1-score of the proposed model is higher than that of other comparative models. Ablation experiments and case analyses demonstrate that criminal law and similar cases play an important auxiliary role in sentencing standardization prediction.
Key words sentencing normativity; multi-source knowledge aggregation; similar case retrieval; attention mecha-nism