首页 / 产品 / 工具平台

300+ 款文件处理工具,
像搭积木一样编排。

把所有开源文件处理工具 Docker 化收纳,一键在线安装到你的目标服务器;文件处理全程跑在你自己的服务器上,无需上传到第三方平台。不带界面的工具还能自由组合成流水线,上一个的输出自动成为下一个的输入。

Docker 一键安装 带 UI + 无 UI 两类工具 可编排文件处理工具链 装在自有服务器 支持自定义接入
看看工具链怎么跑   预约演示 / 咨询私有化部署
先说定位

企业里的"文件处理",为什么值得单独做一层

转格式、做解析、压图片、加水印、做识别——这些活儿在每家企业里天天发生。开源世界里几乎都有现成工具,但它们是一个个独立的软件,各装各的、各用各的,彼此之间还不能串联。

处理跑在你自己的服务器上

工具安装到你指定的目标服务器(可以是企业内网机房),文件全程不离开你的环境,也不需要上传到任何第三方服务平台。

不用一个个去找、去装

平台已收纳 300+ 款常见文件处理工具条目,覆盖 PDF 处理、Office 文档、图片、音视频、压缩解压、代码开发、数据库、DevOps、协作办公、设计绘图、系统监控等 12 大分类,绝大多数处理需求都能直接在平台里找到工具,不用再逐个搜索、逐个部署。

工具能被编排,而不是各自为战

多个不带界面的工具可以组合成一条流水线,自动接力执行,把"人一步步手工操作"变成"配置一次、自动跑完"。

处理结果回到同一条治理链路

工具处理完的文件不是散落在某个临时目录,而是回流佑桥文件资产库,继续受权限、版本与审计的管控。

一句话讲清分工:佑桥核心系统管"文件是什么",工具平台管"文件能被怎么处理",而处理完之后,结果依然属于核心系统——两者是同一条资产链路上的两段。
架构图

工具平台在佑桥体系里的位置

核心系统管「文件是什么」,工具平台管「文件能被怎么处理」;处理完的结果回到文件资产库,继续受权限、版本与审计管控。

图 4 · 知识库平台与工具平台:知识库侧可对接 Dify、RAGFlow、FastGPT、AnythingLLM、MaxKB、WeKnora 六大开源引擎,并按团队与人员建立逻辑隔离的自定义知识库,复用底座的文件、权限、用户与日志;工具侧收纳带界面与不带界面的 Docker 化工具,可编排成文件处理工具链,结果回流文件资产库。
安装机制

Docker 化收纳,设置目标服务器就能一键安装

所有文件处理工具都以 Docker 的方式统一收纳。你只需要告诉系统"要装到哪台服务器上",剩下由系统完成。

为什么选 Docker 之一:环境一致

工具及其依赖被打包在一起,在哪台机器上跑、跑的是什么操作系统版本,结果都一样,消除了"在我机器上能跑、到你机器上跑不起来"的问题。

为什么选 Docker 之二:隔离干净

每个工具跑在自己的容器里互不干扰。装十个工具,不等于给系统装十个可能互相冲突的软件。

为什么选 Docker 之三:装卸方便

需要就装、不需要就卸,不会在系统里留下难以清理的残留,扩容和替换都很轻。

1
选择工具

在工具平台里浏览已收纳的 300+ 款文件处理工具,按"转格式 / 解析 / 图片处理 / OCR / PDF 加工"等需求找到要用的那一款。

2
设置目标服务器

指定这台工具要装到哪台机器上——可以是企业内网机房,也可以是项目专用的某台服务器,不同工具可以落在不同机器。

3
一键在线安装

确认后由系统完成镜像拉取与部署启动,不需要你手动跑一堆命令行,也不需要逐个配置依赖环境。

4
直接使用或接入流水线

带界面的工具打开即用;不带界面的工具注册为可调用的服务节点,随时可以被编排进文件处理工具链。

离线内网怎么办?在完全无法访问外网的环境里,可以改用离线镜像包的方式导入安装,同样能把这些文件处理能力部署进内网。这对政务、军工、医疗、金融等必须数据不出内网的单位尤为关键。
两类工具

按"要不要人亲手操作",工具分成两类

这个分类看起来简单,但它是工具链能力的基础:只有不需要人打开界面的工具,才可能被无人值守地串成流水线。

带 UI 界面
人工直接打开操作

有人坐下来、打开它、用它完成一件事。适合行政、法务、财务、市场等"亲手处理文件"的岗位。

  • 打开浏览器或界面即可使用,无需对接
  • 适合一次性、临时性、需要人工判断的处理
  • 典型:合并拆分 PDF、画图、压缩图片、批量加工
不带 UI 界面
供系统调用

没有人直接打开它,由系统在后台调用,默默完成一件事,再把结果交给下一步。适合要批量、要无人值守的场景。

  • 以服务 / 接口形式被调用,可编排
  • 适合定时、批量、夜间的自动处理任务
  • 典型:格式转换、文档解析、图片加工、PDF 加工
带 UI 界面

带界面工具:打开就能干活

以下是平台上常见的几款代表(均为开源工具,平台上已收纳 300+ 款,此处仅列举常见示例)。

带 UI

Stirling PDF PDF 工具箱

功能相当全面的 PDF 在线工具箱,涵盖合并、拆分、转换、加水印、加密等多种 PDF 操作。

典型用途:行政、法务、财务日常处理 PDF。
带 UI

Excalidraw 画板 手绘风格画板

手绘风格的在线画板,适合快速画流程图、架构草图、示意图,产出可直接存进资产库。

典型用途:产品、研发、售前"画个图说清楚"。
带 UI

JPEG 图片压缩器 图片体积压缩

针对图片体积的专业压缩工具,在可接受的画质下把文件压小,便于传输与归档。

典型用途:市场、电商批量处理图片素材。
带 UI

PDF24 工具箱 PDF 综合处理

另一套 PDF 处理工具箱,覆盖面广,适合希望"一个工具箱解决多种 PDF 操作"的岗位。

典型用途:日常大量 PDF 的格式整理与小加工。
同类扩展

draw.io 流程图与示意图

开源流程图绘制工具,可画业务流程、系统架构、网络拓扑,图纸作为文件资产统一归档。

典型用途:制度流程图、系统架构图、培训教材配图。
同类扩展

File Browser 文件浏览与管理

轻量开源的文件浏览与管理界面,方便在服务器上按目录查看、上传下载与整理待处理文件。

典型用途:工具服务器上的文件整理与临时交接。
不带 UI 界面

不带界面工具:这才是流水线的基本零件

它们没有人机界面,由系统按流水线自动调用,适合批量、定时、无人值守地跑;需要人工把关的环节由流水线上的确认节点承担,工具本身只负责把这一步做透。

无 UI

Gotenberg 文档转 PDF

专注于"把各种文档转成 PDF"的服务,作为流水线里的转换环节使用。

典型用途:Office / HTML 统一转 PDF。
无 UI

Apache Tika 文档解析

把文档里的文字与元数据提取出来,为后续检索、识别、结构化打基础。

典型用途:正文提取、元数据采集、文本层校验。
无 UI

Imagor 图片处理

图片处理服务,可做裁剪、缩放、格式转换等加工,保证输出规格一致。

典型用途:素材图片尺寸与格式标准化。
无 UI

Thumbor 图片处理

另一个图片处理服务,同样服务于裁剪、缩放等需求,可作为图片加工环节的另一个选择。

典型用途:按展示位自动生成不同尺寸图片。
无 UI

Stirling PDF API PDF 加工接口

把 Stirling PDF 的 PDF 处理能力以接口形式提供出来,让系统像调用服务一样调用 PDF 加工。

典型用途:批量统一页面规格、补页码、合并拆分。
无 UI

Tesseract OCR 文字识别引擎

开源 OCR 引擎,对图片型页面做文字识别,补出可被搜索的文本层。

典型用途:扫描件、截屏图片的识别取字。
无 UI

OCRmyPDF PDF 补文字层

为扫描生成的 PDF 追加 OCR 文本层,让原本不可检索的页面变得可以被搜索。

典型用途:档案数字化后的可检索化处理。
无 UI

imgproxy 图片处理服务

面向服务端调用的图片处理服务,按需生成不同尺寸与格式的图片,适合线上场景的实时加工。

典型用途:资产库中图片的按需转码输出。
核心差异化

文件处理工具链:上一个的输出,自动成为下一个的输入

佑桥支持把所有"不带 UI 界面"的工具自由组合成一条流水线。工具逐个接力执行,直到整条链路跑完,全程无需人工搬运文件。

流水线 01

扫描件 → OCR 识别 → 生成可检索 PDF → 归档入库

适用:财务、法务、档案室等大量处理扫描件的部门。

输入 纸质文档扫描件 本质是图片,正文没有文字层,关键词搜不到内容
步骤 1 OCRmyPDF / Tesseract OCR 对缺文字层的页面做 OCR 识别,补出可被搜索的文本层
步骤 2 Gotenberg 转换为适合长期保存的 PDF/A 归档格式,统一规格
步骤 3 Apache Tika 解析正文与元数据,校验文本层质量并抽取业务字段
输出 可检索的归档 PDF 带文字层、格式可长期保存,自动入库并挂上元数据
把"一堆搜不到的扫描件",自动变成"可检索、可归档的组织资产"。
流水线 02

素材图片 → 压缩 → 格式转换 / 水印 → 标准化入资产库

适用:市场、电商等"素材量大、规格要求统一"的团队。

输入 原始素材图片 来源杂、格式不一、体积不一,直接入库不好管
步骤 1 JPEG 图片压缩器 在可接受画质下压缩体积,控制存储与传输成本
步骤 2 Imagor / Thumbor 统一裁剪、缩放与格式转换,输出标准规格图片
步骤 3 Imagor 水印处理 叠加组织要求的统一水印,外发可溯源
输出 规格统一的素材包 尺寸、格式、水印一致,标准化进入资产库待取用
把"每次都要手工改图"的重复劳动,变成一次配置、长期复用。
流水线 03

合同 PDF → 解析抽取要素 → 结构化入库 → 归档留痕

适用:法务、采购、销售等合同与协议类文件的归口部门。

输入 新签合同 PDF 渠道不一、页面规格参差,正文难以直接检索
步骤 1 Apache Tika 提取合同正文与基础元数据,为要素抽取做准备
步骤 2 Stirling PDF API 统一页面尺寸、补充页码,让对外归档的合同更规范
步骤 3 Gotenberg 对不规范来件做格式转换,输出统一的归档版本
输出 要素可查的合同记录 结构化字段入资产库,原件归档封存、操作全程留痕
把"签完就随手存"的合同,变成"可检索、可归档、可审计"的合规记录。
以上三条仅为示例。实际使用中,流水线的节点数量、顺序、参数都可以自由调整:你可以只跑两步,也可以把十几个工具串成一条长链;一次配置之后即可批量执行、无人值守。
开放性

平台没有的工具,你可以自己接进来

"300+ 款"解决的是"常用工具不用自己找";"可自定义"解决的是"特殊工具不用等平台"。

自定义接入新工具

如果某个平台里还没有、但组织确实需要的开源工具出现了,你可以自己把它接进平台,与其他工具一样统一管理、统一调用。

同样能进流水线

接入的工具只要是不带界面的服务形态,就能像内置工具一样成为流水线上的一个节点,参与自动接力。

不被平台清单锁死

工具清单可以长,能力边界却不必封死。这是佑桥在多个层面保持一致的态度:不锁死底座、不锁死存储、也不锁死工具。

闭环

处理完的文件,回到佑桥底座继续被治理

工具平台不是孤岛。它的产出必须回到核心系统,才形成一条完整的资产链路。

结果回到文件资产库

工具链处理完的文件自动进入核心系统的文件资产库,成为组织资产的一部分,而不是留在某个工具的临时目录里。

带上元数据与处理痕迹

谁处理的、什么时候处理的、经过了哪些处理步骤,都会被记录下来,同样进入审计链路,事后可追溯。

任务可被调度与监控

工具链任务的执行可由核心系统的调度能力支撑,可以设定"到点自动跑",并随时查看执行情况。

合起来是一句话:工具平台负责"把文件处理好",处理完之后,这份文件在权限、版本、封存、检索、审计上的规则,与手工上传的文件完全一致。
下一步

想看看你这条流水线能怎么搭?

把你的文件类型与处理步骤告诉我们,我们来演示一条真正能跑在你自己服务器上的工具链。

预约演示   了解辅助软件   看看 97 款子系统