精选论文4

这里是完整的精选论文页。首页只承担快速扫读,这里保留更长摘要、作者列表、发表信息和外部链接。
  1. Siyuan Li*Jian Chen*Rui YaoXuming HuPeilin ZhouWeihua QiuSimin ZhangChucheng DongZhiyao LiQipeng XieZixuan Yuan

    首个面向中文金融监管合规的大规模数据集,并配套自动化合规检查流程。

    监管合规已经成为公司治理的基础,需要遵循系统化的法律框架。金融监管规则往往包含复杂条款、层级逻辑和大量例外,因此在人工理解和审查时成本很高。近年来,监管科技和大语言模型开始被用于把监管文本自动转换为可执行的合规逻辑,但在中文金融监管场景中仍然存在三类问题:领域知识表示不完整、层级推理能力不足,以及难以维持时间和逻辑一致性。为此,我们提出 Compliance-to-Code,这是首个专门面向中文金融监管合规的大规模数据集。该数据集覆盖十类金融法规中的 361 部法规和 1,159 条标注条款,每条条款都被模块化为主体、条件、约束和上下文信息,并配套监管关系。我们还提供确定性的 Python 代码映射、详细推理过程和解释,以支持自动化审计。为展示其实用性,我们进一步提出 FinCheck 这一端到端流程,支持法规结构化、代码生成和报告生成。

    KDD 2026 Dataset & Benchmark Track, Poster

  2. Jian Chen*Siyuan Li*Chucheng WanZixuan Yuan

    面向规则、例外与作用域关系的 span-grounded 法律解析框架。

    这项工作针对法规解析中的隐式遗漏问题,把法规拆解为 span-grounded deontic trees。该表示方式将规则、例外与作用域关系显式保留,从而更可靠地追踪和审计复杂的法律控制流。

    KDD 2026 Dataset & Benchmark Track, Poster

  3. Junhao Chen*Yu Huang*Siyuan Li*Rui YaoHanqian LiHanyu ZhangJungang LiJian ChenBowen WangXuming Hu

    面向知识密集领域多轮长文本问答的评测基准。

    多轮长文本问答是大语言模型在知识密集领域中的重要应用形式,但现有基准大多只覆盖单轮对话,而多轮基准通常评测的是其他能力,并不能真正衡量知识密集场景下的事实性。为填补这一空缺,我们提出 KnowMT-Bench,这是首个系统评测知识密集领域多轮长文本问答能力的基准,覆盖医学、金融与法律等场景。为了更贴近真实使用环境,KnowMT-Bench 采用动态评测设置:模型需要根据逻辑递进的问题序列,自行生成多轮对话历史。随后,我们通过人工验证的自动化流程评估最终回答的事实能力和信息传递效率。实验表明,多轮上下文会带来性能下降:一方面,自生成历史会引入上下文噪声,削弱事实能力;另一方面,随着对话变长,模型往往更啰嗦,信息效率也会下降。我们进一步研究了缓解方法,结果表明检索增强生成可以有效减轻甚至逆转这种退化。上述发现说明,KnowMT-Bench 对评估和提升真实知识密集应用中的对话事实能力具有重要意义。代码见 https://github.com/hardenyu21/KnowMT-Bench。

    arXiv preprint

  4. Rui YaoQi ChaiJinhai YaoSiyuan LiJunhao ChenQi ZhangHao Wang

    结合货币政策传导路径与不确定性解码,更可靠地识别美联储沟通中的政策立场。

    Fedspeak 是美联储使用的一种风格化且含义细腻的语言,能够传达隐含的政策信号和策略立场。联邦公开市场委员会也会策略性地使用这种表达来影响市场预期,并作用于国内外经济环境。因此,自动解析和解释 Fedspeak 是一个高影响力任务,对金融预测、算法交易和数据驱动的政策分析都有重要意义。为此,我们提出一个基于大语言模型、并考虑不确定性的框架,用于理解 Fedspeak 并判断其背后的货币政策立场。在技术上,我们把货币政策传导机制中的领域知识引入文本表示,以增强其语义和上下文表达;同时加入动态不确定性解码模块,用来估计模型预测的置信度,从而提升分类准确率和模型可靠性。实验结果表明,我们的方法在政策立场分析任务上达到了当前最优表现。

    AAAI 2026, Oral