Skip to main content
本教程基于 Python 示例分步讲解如何使用 xParse。我们提供了完整的示例代码,可在本地一键运行,助您快速体验 Pipeline 的强大能力。

为什么使用 xParse?

在大模型和 RAG 应用开发中,文档处理是关键环节。传统方式需要分别调用解析、分块、向量化等多个接口,流程复杂且容易出错。xParse 通过统一的 Pipeline API,一次性完成文档解析、智能分块和向量化全流程,让您专注于业务逻辑,无需处理繁琐的数据转换。 使用 xParse,您可以:
  • 一键完成全流程:通过单个 API 调用完成 parse → chunk → embed 全流程
  • 灵活配置处理策略:根据文档类型选择合适的分块策略和向量模型
  • 无缝对接向量数据库:处理结果直接存储到 Milvus/Zilliz,无需额外转换
  • 支持批量处理:自动处理数据源中的所有文档,支持大规模文档处理
如果您正在构建 RAG 应用、知识库系统或 Agent 应用,xParse 会是您的得力助手。

如何使用 xParse?

您可以参考以下示例和步骤,快速验证并将 xParse 接入系统。

先决条件:获取 API Key

使用 xParse 处理文档前,需要先获取 API Key。请登录后前往 TextIn 工作台 - 账号与开发者信息 获取 x-ti-app-idx-ti-secret-code

步骤 1:安装依赖

使用 pip 安装 xparse-client 包:

步骤 2:选择创建方式

xParse Pipeline 支持两种创建方式:
  1. 手动创建组件(推荐):手动创建配置对象传入Pipeline,提供更好的类型检查、代码复用和灵活控制
  2. 通过配置创建:使用 JSON 配置,简单直观,适合快速原型开发

步骤 3:编写代码

方式 1:手动按模块创建组件(推荐)

更完善灵活的创建逻辑,适合大多数场景:

方式 2:通过JSON格式配置创建

这是最简单的方式,适合快速上手:

步骤 4:运行代码

将代码保存为 run_pipeline.py,然后运行:
您将看到类似以下的输出:

配置说明

Source(数据源)配置

S3/MinIO 数据源

FTP 数据源

本地文件系统数据源

更多数据源配置参考:数据源 - Sources

Destination(目标存储)配置

Milvus 向量数据库

Zilliz 向量数据库(云端)

本地文件系统

更多目标存储配置参考:目的地 - Destinations

Parse(解析)配置

解析配置决定了使用哪个引擎解析文档: 更多解析配置参考:解析 - Parse

Chunk(分块)配置

分块配置决定了文档如何被切分成适合向量化的文本块: 分块策略选择建议
  • basic:适合一般文档,按固定字符数分割
  • by_title:适合结构化文档(如技术文档、产品手册),保持章节完整性
  • by_page:适合 PDF 文档,保持页面完整性
更多分块配置参考:分块 - Chunk

Embed(向量化)配置

向量化配置决定了使用哪个模型将文本转换为向量: 支持的模型
  • qwen(通义千问)
    • text-embedding-v3:通用向量模型
    • text-embedding-v4:更高精度的向量模型
  • doubao(火山引擎)
    • doubao-embedding-large-text-250515:大模型版本
    • doubao-embedding-text-240715:标准版本
更多向量化配置参考:向量化 - Embed

Extract(信息抽取)配置

信息抽取配置决定了从文档中提取哪些结构化信息: 使用限制
  • Extract必须与Parse组合使用
  • Extract必须在Parse之后
  • Extract不能与Chunk、Embed同时使用
更多抽取配置参考:信息抽取 - Extract

使用示例

示例 1:本地文件到本地输出(测试)

最简单的测试场景,适合快速验证功能:

示例 2:S3 到 Milvus(生产环境)

典型的生产环境配置,从 S3 读取文档,存储到 Milvus 向量数据库:

示例 3:不同分块策略的配置

根据文档类型选择合适的分块策略:

示例 4:解析 + 抽取

这里为您提供了一份Textin官方示例图片,您可以点击下载使用:文档抽取png示例.pngExtract Sample Image
如果您需要从文档中提取结构化信息:

示例 5:处理单个文件并获取统计信息

如果您需要处理单个文件并获取详细的统计信息:

查看结果

本地文件输出

如果使用本地文件系统作为目标存储,处理结果会保存为 JSON 文件:

Milvus 向量数据库

如果使用 Milvus 作为目标存储,向量数据会直接存储到集合中,您可以使用 Milvus 客户端进行查询:

API选择指南

xParse提供了多种API接口,适用于不同的使用场景:

Pipeline API

适用场景
  • 需要组合多个处理阶段(parse + chunk + embed)
  • 需要组合解析和抽取(parse + extract)
  • 需要批量处理文档
  • 需要将结果存储到向量数据库
API文档Pipeline API

Parse同步API

适用场景
  • 只需要文档解析功能
  • 需要同步获取结果
  • 处理单个文档或小文件(<10MB)
API文档Parse同步API

Parse异步API

适用场景
  • 处理大文件(>10MB)或批量文件
  • 需要异步处理,避免长时间等待
  • 需要webhook回调通知
API文档Parse异步API

Extract同步API

适用场景
  • 只需要抽取功能
  • 不需要保留解析结果
  • 处理单个文档
API文档Extract同步API 使用教程:详细的使用示例和最佳实践请参考API使用指南

选择建议

下一步

如果您在使用过程中遇到问题,可以查看 故障排除指南 或联系技术支持。

故障排除

API 连接失败

  • 检查 api_base_url 是否正确(应为 https://api.textin.com/api/xparse
  • 确认 x-ti-app-idx-ti-secret-code 配置正确
  • 确认网络连接正常

S3 连接失败

  • 验证 endpoint、access_key、secret_key 是否正确
  • 确认 bucket 存在且有访问权限
  • 检查网络连接和防火墙设置

Milvus 写入失败

  • 检查向量维度是否匹配(当前 Pipeline API 使用 1024 维度)
  • 确认集合中包含必需字段:element_idtextrecord_idembeddingsmetadata
  • 查看 Milvus 日志获取详细错误信息

本地文件找不到

  • 确认文件路径正确
  • 检查文件匹配模式(pattern)是否正确
  • 验证文件权限

处理速度慢

  • 考虑使用更高性能的向量模型(如 text-embedding-v4
  • 调整分块策略,减少分块数量
  • 检查网络连接速度