为什么使用 xParse?
在大模型和 RAG 应用开发中,文档处理是关键环节。传统方式需要分别调用解析、分块、向量化等多个接口,流程复杂且容易出错。xParse 通过统一的 Pipeline API,一次性完成文档解析、智能分块和向量化全流程,让您专注于业务逻辑,无需处理繁琐的数据转换。 使用 xParse,您可以:- ✅ 一键完成全流程:通过单个 API 调用完成 parse → chunk → embed 全流程
- ✅ 灵活配置处理策略:根据文档类型选择合适的分块策略和向量模型
- ✅ 无缝对接向量数据库:处理结果直接存储到 Milvus/Zilliz,无需额外转换
- ✅ 支持批量处理:自动处理数据源中的所有文档,支持大规模文档处理
如何使用 xParse?
您可以参考以下示例和步骤,快速验证并将 xParse 接入系统。先决条件:获取 API Key
使用 xParse 处理文档前,需要先获取 API Key。请登录后前往 TextIn 工作台 - 账号与开发者信息 获取x-ti-app-id 和 x-ti-secret-code。
步骤 1:安装依赖
使用 pip 安装 xparse-client 包:步骤 2:选择创建方式
xParse Pipeline 支持两种创建方式:- 手动创建组件(推荐):手动创建配置对象传入Pipeline,提供更好的类型检查、代码复用和灵活控制
- 通过配置创建:使用 JSON 配置,简单直观,适合快速原型开发
步骤 3:编写代码
方式 1:手动按模块创建组件(推荐)
更完善灵活的创建逻辑,适合大多数场景:方式 2:通过JSON格式配置创建
这是最简单的方式,适合快速上手:步骤 4:运行代码
将代码保存为run_pipeline.py,然后运行:
配置说明
Source(数据源)配置
S3/MinIO 数据源
FTP 数据源
本地文件系统数据源
Destination(目标存储)配置
Milvus 向量数据库
Zilliz 向量数据库(云端)
本地文件系统
Parse(解析)配置
解析配置决定了使用哪个引擎解析文档:
更多解析配置参考:解析 - Parse
Chunk(分块)配置
分块配置决定了文档如何被切分成适合向量化的文本块:
分块策略选择建议:
- basic:适合一般文档,按固定字符数分割
- by_title:适合结构化文档(如技术文档、产品手册),保持章节完整性
- by_page:适合 PDF 文档,保持页面完整性
Embed(向量化)配置
向量化配置决定了使用哪个模型将文本转换为向量:
支持的模型:
- qwen(通义千问):
text-embedding-v3:通用向量模型text-embedding-v4:更高精度的向量模型
- doubao(火山引擎):
doubao-embedding-large-text-250515:大模型版本doubao-embedding-text-240715:标准版本
Extract(信息抽取)配置
信息抽取配置决定了从文档中提取哪些结构化信息:
使用限制:
- Extract必须与Parse组合使用
- Extract必须在Parse之后
- Extract不能与Chunk、Embed同时使用
使用示例
示例 1:本地文件到本地输出(测试)
最简单的测试场景,适合快速验证功能:示例 2:S3 到 Milvus(生产环境)
典型的生产环境配置,从 S3 读取文档,存储到 Milvus 向量数据库:示例 3:不同分块策略的配置
根据文档类型选择合适的分块策略:示例 4:解析 + 抽取
如果您需要从文档中提取结构化信息:示例 5:处理单个文件并获取统计信息
如果您需要处理单个文件并获取详细的统计信息:查看结果
本地文件输出
如果使用本地文件系统作为目标存储,处理结果会保存为 JSON 文件:Milvus 向量数据库
如果使用 Milvus 作为目标存储,向量数据会直接存储到集合中,您可以使用 Milvus 客户端进行查询:API选择指南
xParse提供了多种API接口,适用于不同的使用场景:Pipeline API
适用场景:- 需要组合多个处理阶段(parse + chunk + embed)
- 需要组合解析和抽取(parse + extract)
- 需要批量处理文档
- 需要将结果存储到向量数据库
Parse同步API
适用场景:- 只需要文档解析功能
- 需要同步获取结果
- 处理单个文档或小文件(<10MB)
Parse异步API
适用场景:- 处理大文件(>10MB)或批量文件
- 需要异步处理,避免长时间等待
- 需要webhook回调通知
Extract同步API
适用场景:- 只需要抽取功能
- 不需要保留解析结果
- 处理单个文档
选择建议
下一步
- 了解文档元素和元数据:了解 Pipeline 处理后的数据结构
- 深入了解核心模块:
- 文档解析(Parse) - 了解如何配置解析参数
- 文本分块(Chunk) - 了解分块策略和参数配置
- 向量化(Embed) - 了解向量模型选择和配置
- 信息抽取(Extract) - 了解如何配置抽取参数
- 阅读Agent/RAG 实战教程:了解如何使用 xParse 构建完整的 RAG 应用与 LangChain Agent
- 查看API 文档:了解 Pipeline API 的详细参数和返回格式
故障排除
API 连接失败
- 检查
api_base_url是否正确(应为https://api.textin.com/api/xparse) - 确认
x-ti-app-id和x-ti-secret-code配置正确 - 确认网络连接正常
S3 连接失败
- 验证 endpoint、access_key、secret_key 是否正确
- 确认 bucket 存在且有访问权限
- 检查网络连接和防火墙设置
Milvus 写入失败
- 检查向量维度是否匹配(当前 Pipeline API 使用 1024 维度)
- 确认集合中包含必需字段:
element_id、text、record_id、embeddings、metadata - 查看 Milvus 日志获取详细错误信息
本地文件找不到
- 确认文件路径正确
- 检查文件匹配模式(pattern)是否正确
- 验证文件权限
处理速度慢
- 考虑使用更高性能的向量模型(如
text-embedding-v4) - 调整分块策略,减少分块数量
- 检查网络连接速度


