智能文档抽取与合规脱敏 | Spire.Agent.Office
|
028-81705109
|
|
微信扫一扫
|

Spire.Cloud 纯前端文档控件
背景模糊图
AI 驱动 · 合规脱敏 · 批量处理

多源混合文档
抽取与合规脱敏

批量导入 PDF、Word、PPT 等混合格式文档,AI 自动提取关键信息并智能
擦除敏感 PII 数据,生成结构化 Excel 清单与脱敏归档 PDF。

100+
并发文件处理
95%+
字段提取准确率(行业基准)
3 分钟
批量处理时效

交互式演示

上传一批文档,体验 Agent 批量抽取与合规脱敏全流程

PDF

员工履历表.pdf

DOCX

员工联系人信息.docx

XLSX

员工信息登记表.xlsx

开始批量处理

PDF

银行及薪酬信息.pdf

DOCX

职业资格证书.docx

PPTX

岗位任职材料.pptx

解析多份文档(1/4)

批量解析多份文档 (PDF/DOCX/XLSX/PPTX)

处理完成

处理结果预览

员工档案结构化清单.xlsx
员工档案结构化清单
注:页面中的示例文档仅用于展示产品功能,相关内容不对应真实实体或业务信息。

工作流程

四步完成从原始文档到合规数据的转换

01
02
03
04

批量解析

支持 PDF、Word、PPT 等
混合格式, 拖拽上传
或指定文件夹

理解与抽取

Agent 并发识别姓名、
学历、资质等 关键字段,
结构化抽取

PII 脱敏与人工复核

识别身份证号、住址
等敏感信息,Agent 推理
决策脱敏,人工复核确认

生成归档

生成原生 Excel 清单与
脱敏 PDF 文档,
自动落盘归档

开发者能力拆解

可嵌入、易拓展的脱敏 Agent,无缝对接现有内容合规系统

Parse

多格式解析

Spire.PDF / Doc / Presentation 批量读取

Understand

理解与抽取

结构化信息 + PII 类型识别

Reason

Agent 决策

规则 + 可配置脱敏策略

Generate

原生输出

Spire.XLS 清单 + 脱敏 PDF

// 创建批量处理 Agent,抽取字段并输出脱敏结果
string instruction =
"批量读取附件中的 PDF、Word、PPT 格式文档,自动识别并提取每份文档的关键信息(如'姓名' '学历' '资质' '联系方式'等)," +
"每份文档一行,生成结构化 Excel 清单,同时针对'联系方式'信息脱敏,最终保存输出为Excel格式和PDF格式";

// 创建AIOptions选项配置
AIOptions options = new AIOptions();

// 设置SpireToken Key
options.SpireToken = "**************************";

options.WorkDir= "out";

// 使用Workbook对象
using (Workbook xls = new Workbook())
{
    // 创建AI文档处理器
    AIDocumentProcessor processor = xls.AI(options);

    // 执行AI指令
    processor.ExecuteInstruction(xls, instruction, null, new string[] { "in.pdf", "in.docx", "in.pptx" });
}


  
背景光晕

核心能力

专为合规文档处理打造的 Agent

跨格式精准解析

多格式并发解析

同时处理 PDF、DOCX、PPTX 等混合格式文档,智能识别文本、表格、图片中的结构化信息,字段提取准确率可达 95% 以上(行业基准)。

语义级条款比对

智能 PII 识别

基于大模型推理(Agent 框架)自动识别身份证号、手机号、住址、邮箱等 20+ 类敏感信息,支持自定义脱敏 Agent 决策。

原生修订模式

结构化数据输出

提取结果自动映射到预定义模板,生成标准 Excel 清单,支持 CSV、JSON、API 接口等多种导出格式。

AI 法律建议

不可逆脱敏

敏感信息采用哈希擦除技术,底层数据永久删除且不可恢复,符合 GDPR、个人信息保护法等合规要求。

多版本管理

批量并发处理

分布式处理架构,支持单次上传 100+ 文件,100 个文件批量处理仅需 3 分钟,效率提升 20 倍。

批量合同审查

标准化归档

支持批量上传多份合同进行比对,30 页合同平均 10 分钟完成全部比对和修订。

安全与合规

企业级数据安全保护,符合国内外隐私法规要求

租赁合同

GDPR 合规

符合欧盟通用数据保护条例要求,
支持数据主体权利请求处理。

劳动合同

个人信息保护法

遵循中国《个人信息保护法》(PIPL),
最小化数据采集原则。

采购合同

数据安全保护

实施传输与存储加密机制,数据在传输、
静态存储环节均受加密保护。

常见问题

支持哪些文档格式? Arrow

目前支持 PDF(含扫描版)、Word (.doc/.docx)、PowerPoint (.ppt/.pptx)、Excel (.xls/.xlsx) 以及图片格式 (JPG/PNG/TIFF)。扫描版 PDF 会自动触发 OCR 识别。

PII 脱敏的准确率如何? Arrow

支持 20+ 类敏感信息识别,包括身份证号、手机号、邮箱、地址、银行卡号等,同时支持自定义脱敏规则与人工复核兜底,准确率满足合规审计要求。

脱敏后的数据可以恢复吗? Arrow

不可以。Spire.Agent.Office 采用不可逆擦除技术,敏感信息在底层被永久删除且无法恢复。这符合 GDPR 和《个人信息保护法》中关于"数据最小化"和"被遗忘权"的要求。

批量处理的最大文件数量是多少? Arrow

标准版支持单次 100 个文件,企业版支持单次 100+ 文件。100 个文件(PDF+Word 混合)的批量处理时间约 3 分钟。

可以自定义提取的字段模板吗? Arrow

可以。系统预置了简历、资质证书、员工档案等常用模板,同时也支持自定义字段映射。您可以通过可视化界面配置提取规则和数据映射关系。

数据安全如何保障? Arrow

所有数据传输采用 TLS 1.3 加密,存储采用 AES-256 加密。处理完成后原始文件在 24 小时内自动删除。支持私有化部署,数据完全留在您的内网环境中。

准备好提升合同审查效率了吗?

免费领取 1 个月开发者授权