Skip to main content
本教程面向财务审计、合规审核等场景,展示如何利用 xParse 作为数据底座,构建能够自动解析财务文档、提取关键信息、进行合规性检查和异常检测的智能 Agent。

场景介绍

业务痛点

在企业财务审计和合规审核场景中,审计人员面临以下挑战:
  • 文档量大:需要处理大量财务报表、合同、发票、银行对账单等文档
  • 信息提取繁琐:需要从非结构化文档中提取关键财务指标(金额、日期、合同条款等)
  • 合规性检查复杂:需要对照法规和内部政策,检查合同条款、财务数据是否符合规范
  • 异常检测困难:需要识别金额异常、日期冲突、数据不一致等问题
  • 追溯困难:发现问题后,需要追溯到原始文档的具体位置进行验证

解决方案

通过构建财务审计 Agent,我们可以实现:
  • 自动化文档解析:使用 xParse SDK 自动解析各类财务文档,构建向量知识库
  • 智能信息提取:使用 xParse Extract API 从原始文档中结构化提取关键财务数据
  • 合规性自动检查:基于知识库和历史案例,自动检查合规性
  • 异常自动检测:识别金额异常、日期冲突等异常情况
  • 结果可追溯:Extract API 支持引用溯源,保留原始元素和坐标信息

架构设计

环境准备

提示:TEXTIN_APP_IDTEXTIN_SECRET_CODE 参考 API Key,请登录 Textin 工作台 获取。示例中使用 通义千问 的大模型能力,其他模型用法类似。

Step 1:使用 xParse SDK 解析文档

针对财务审计场景,我们使用 xParse SDK 解析文档,再通过 LangChain 进行分块和向量化:
  • 分块策略:按页面分组后使用 RecursiveCharacterTextSplitter 分块,保持页面完整性,便于追溯
  • 向量化:使用 DashScopeEmbeddings 进行向量化

Step 2:构建 LangChain Tools

Extract 提取工具

使用 xParse Extract API 直接从原始文档中结构化提取财务数据,无需依赖正则匹配:

Tool 2: 合规性检查

Tool 3: 异常检测

Tool 4: 检索历史案例

组装所有Tools

Step 3:配置 LangChain Agent

Step 4:完整示例代码

使用示例

示例1:提取财务数据

示例2:提取指定文件的财务数据

示例3:合规性检查

示例4:异常检测

最佳实践

  1. 文档预处理:确保文档格式统一,命名规范(如:合同_2024Q1_供应商A.pdf
  2. 分块策略:按页面分组后使用 RecursiveCharacterTextSplitter 分块,保持页面完整性,便于追溯
  3. 向量化配置:使用 DashScopeEmbeddingstext-embedding-v3 模型获得更好的语义理解
  4. 结构化提取:使用 Extract API 定义精确的 Schema,提取结构化财务数据,避免正则匹配的局限性
  5. 引用溯源:开启 generate_citations 获取提取结果的原文引用,便于审计追溯
  6. 合规规则配置:将合规规则存储在配置文件中,便于更新和维护
  7. 异常阈值设置:根据业务需求设置合理的异常检测阈值
  8. 结果追溯:在 Agent 回答中包含文档名称和页码,便于人工验证

常见问题

Q: 如何处理加密的PDF文档?
A: 在调用 client.parse.run() 时添加 pdf_pwd 参数,或在处理前先解密文档。
Q: 如何提高提取准确率?
A: 1) 使用 Extract API 进行结构化提取,定义精确的 Schema;2) 使用 text-embedding-v3 模型进行向量检索;3) 开启 generate_citations 验证提取结果。
Q: Extract API 支持哪些文件格式?
A: 支持 PDF、Word(docx)、Excel(xlsx)、图片(PNG/JPG)等常见格式,文件通过 base64 编码上传。
Q: 如何集成到现有审计系统?
A: 可以将 Agent 封装为 REST API,通过HTTP接口调用,或集成到现有的审计工作流中。

相关文档