资讯动态

DataX Web 全量指南:基于 DataX 的分布式数据同步调度平台架构、部署与实战

发布时间:2026/10/3 2:28:50 来源:尧图企业网站定制
数据集成数据同步任务调度后端【免费下载链接】datax-webDataX集成可视化页面选择数据源即可一键生成数据同步任务支持RDBMS、Hive、HBase、ClickHouse、MongoDB等数据源批量创建RDBMS数据同步任务集成开源调度系统支持分布式、增量同步数据、实时查看运行日志、监控执行器资源、KILL运行进程、数据源信息加密等。项目地址https://gitcode.com/gh_mirrors/da/datax-web点击查看免费下载DataX Web 是在阿里开源同步引擎 DataX 之上开发的分布式数据同步与调度平台它把 DataX 的任务 JSON 构建、数据源管理、定时调度、日志查看与进程终止全部搬到页面上显著降低 DataX 的使用门槛。本文以本仓库 README.md 为骨架结合 datax-admin、datax-executor、datax-core 等模块源码系统讲解 DataX Web 的架构设计、环境要求、执行器与调度中心配置、JSON 构建、增量同步、动态分区、任务运行与监控等完整链路读者可据此快速上手并深入理解其底层实现。一、DataX Web 是什么DataX Web 是在 DataX 之上开发的分布式数据同步工具提供简单易用的操作界面核心目标是降低用户使用 DataX 的学习成本、缩短任务配置时间、避免配置过程中出错。用户通过页面选择数据源即可创建数据同步任务支持 RDBMS、Hive、HBase、ClickHouse、MongoDB 等数据源RDBMS 数据源可批量创建数据同步任务支持实时查看数据同步进度与日志并提供终止同步功能同时集成并二次开发了 xxl-job可根据时间、自增主键增量同步数据。任务执行器支持集群部署支持执行器多节点路由策略选择支持超时控制、失败重试、失败告警、任务依赖以及执行器 CPU、内存、负载的监控。项目后续规划还包括更多数据源支持、数据转换 UDF、表结构同步、数据同步血缘等复杂业务场景见 README.md。从仓库结构看项目由四个 Maven 子模块组成职责边界清晰模块职责关键目录datax-admin调度中心Web 管理端负责任务管理、数据源管理、JSON 构建、调度触发、日志与报表com.wugui.datax.admindatax-executor任务执行器接收调度指令拉起 DataX 进程并回传日志与结果com.wugui.datax.executordatax-core公共核心提供执行器、JobHandler、Glue、日志、线程模型等基础能力com.wugui.datatx.coredatax-rpcRPC 通信与注册中心旧版在old包新版含 netty、netty_http、hessian 序列化等com.wugui.datax.rpc二、系统要求与环境按 README.md 的系统要求部署前需确认以下环境语言环境Java 8JDK 版本建议 1.8.201 以上Python 2.7如需支持 Python3需修改替换datax/bin下的三个 python 文件替换文件位于 doc/datax-web/datax-python3 目录内含datax.py、dxprof.py、perftrace.py。操作系统MacOS、Windows、Linux。数据库Mysql5.7。两个核心服务的默认端口与连接配置在 Spring Boot 配置文件中调度中心 datax-admin/src/main/resources/application.yml端口由server.port环境变量指定默认注释为 8080MySQL 连接通过DB_HOST、DB_PORT、DB_DATABASE、DB_USERNAME、DB_PASSWORD环境变量注入默认库名dataxweb连接池使用 HikariCPmaximum-pool-size: 10、minimum-idle: 5、connection-timeout: 30000。执行器 datax-executor/src/main/resources/application.yml端口由executor.port指定默认 9999调度中心地址由datax.job.admin.addresses指定默认http://127.0.0.1:${datax.admin.port}JSON 临时目录由datax.executor.jsonpath指定DataX 脚本路径由datax.pypath指定。三、核心功能特性一览README.md 累计罗列了 41 项功能特性归纳为以下几大类任务构建与数据源通过 Web 构建 DataX JsonJSON 保存在数据库中方便任务迁移与管理。数据源支持 Hive、MySQL、Oracle、PostgreSQL、SqlServer、HBase、MongoDB、ClickHouseJDBC 添加 Hive 数据源支持可在构建 JSON 页面选择数据源生成 column 信息并简化配置。添加 HBase 数据源支持JSON 构建可通过 HBase 数据源获取 hbaseConfig、column添加 MongoDB 数据源支持仅需选择 collectionName 即可完成 JSON 构建JSON 构建增加 ClickHouse 数据源支持RDBMS 数据源增加批量任务创建功能选择数据源、表即可根据模板批量生成 DataX 同步任务提供 24 类插件 DataX JSON 配置样例。数据源信息加密存储数据源管理对用户名和密码进行加密JSON 文件中的用户名密码加密存储执行 DataX 任务时解密。调度与执行支持 DataX 定时任务支持动态修改任务状态、启动/停止任务、终止运行中任务即时生效。调度采用中心式设计支持集群部署任务分布式执行执行器支持集群部署执行器周期性自动注册调度中心自动发现并触发执行。路由策略第一个、最后一个、轮询、随机、一致性 HASH、最不经常使用LFU、最近最久未使用LRU、故障转移、忙碌转移。阻塞处理策略单机串行默认、丢弃后续调度、覆盖之前调度。任务超时控制可自定义超时时间运行超时主动中断任务对超时任务 kill datax 进程可配合重试策略避免网络问题导致的 DataX 卡死。任务失败重试可自定义重试次数失败告警默认提供邮件方式同时预留扩展接口。任务依赖支持配置子任务依赖父任务成功后自动触发子任务多个子任务用逗号分隔。任务类型由 DataX 任务扩展到 Shell 任务、Python 任务、PowerShell 任务脚本类型任务支持停止功能。运维与监控Web 实时查看抽取日志类似 Jenkins 的日志控制台输出DataX 运行记录展示可页面操作停止 DataX 作业。执行器 CPU、内存、负载监控页面图形化展示运行报表支持实时查看运行数据与调度报表调度日期分布图、调度成功分布图。日志页面增加 DataX 执行结果统计数据公共字段创建时间、创建人、修改时间、修改者插入或更新时自动填充对应 MybatisMetaObjectHandler.javaswagger 接口进行 token 验证。四、快速开始与部署README.md 提供了三个入口快速开始指南userGuid.md。Linux 一键部署文档doc/datax-web/datax-web-deploy.md。仓库另有 doc/datax-web/datax-web-deploy-V2.1.1.md 供参考。部署时优先通过环境变量获取 DataX 文件目录集群部署时不用指定 JSON 及日志目录页面可配置 DataX 启动 JVM 参数。五、执行器配置基于 xxl-job5.1 执行器列表与在线状态README.md 描述了执行器页面的两个关键区域调度中心 OnLine右侧显示在线的调度中心列表。任务执行结束后将以 failover 的模式回调调度中心通知执行结果避免回调的单点风险。执行器列表显示在线的执行器列表可通过 OnLine 机器 查看对应执行器的集群机器。5.2 执行器属性说明README.md 给出了新增执行器时的属性定义AppName与 datax-executor/src/main/resources/application.yml 中datax.job.executor.appname默认datax-executor保持一致。它是每个执行器集群的唯一标识执行器会周期性以 AppName 为对象进行自动注册调度中心通过该配置自动发现注册成功的执行器供任务调度使用。名称执行器的可读名称AppName 受字母数字限制可读性不强名称用于提高可读性。排序执行器的排序任务新增等需要执行器的地方会按该排序读取可用执行器列表。注册方式调度中心获取执行器地址的方式。自动注册执行器自动注册调度中心通过底层注册表动态发现执行器机器地址手动录入人工手动录入执行器地址多地址用逗号分隔。机器地址注册方式为手动录入时有效支持人工维护执行器地址信息。从源码看执行器向调度中心注册时会上报 CPU 使用率、内存使用率与系统负载见 AdminBizImpl.java 的registry方法这些数据正是监控页面图形化的数据来源。5.3 路由策略的源码实现README 列出的 9 种路由策略在 ExecutorRouteStrategyEnum.java 中均有对应实现类位于com.wugui.datax.admin.core.route.strategy包下策略枚举项实现类第一个FIRSTExecutorRouteFirst最后一个LASTExecutorRouteLast轮询ROUNDExecutorRouteRound随机RANDOMExecutorRouteRandom一致性 HASHCONSISTENT_HASHExecutorRouteConsistentHash最不经常使用LEAST_FREQUENTLY_USEDExecutorRouteLFU最近最久未使用LEAST_RECENTLY_USEDExecutorRouteLRU故障转移FAILOVERExecutorRouteFailover忙碌转移BUSYOVERExecutorRouteBusyover枚举还包含SHARDING_BROADCAST分片广播其 router 为 null属于特殊的广播型路由。策略名称通过I18nUtil国际化加载支持中英文界面。六、创建数据源与任务模板6.1 创建数据源README 中创建数据源是任务配置链路的第一步对应 README.md之后在 JSON 构建页面第 4 步和批量创建任务时使用。数据源信息安全值得注意v2.1.1 起数据源管理对用户名和密码进行加密存储v2.1.2 修改了加密算法并优化代码。加密实现见 AESUtil.java基于 AES 算法密钥算法AES、随机数算法SHA1PRNG加密后的密文以 Base64 输出对称密钥配置在 application.yml 的datasource.aes.key默认AD42F6697B035B75。数据库实体 JobDatasource.java 配合 AESEncryptHandler.java 实现字段级加解密。注意由于 2.1.1 与 2.1.2 加密方式变更2.1.1 版本不建议升级否则已加密的数据源会解密失败如需升级请重建数据源与任务见 README.md。数据源配置成功后还提供手动测试功能对应DatasourceQueryService及其实现 DatasourceQueryServiceImpl.java查询工具类在tool/query包下如 MySQLQueryTool、HiveQueryTool、HBaseQueryTool 等。6.2 创建任务模板创建任务模板README.md允许对常用任务配置模板在构建完 JSON 之后可选择关联模板创建任务。模板管理由 JobTemplateController.java、JobTemplateService 支撑实体为 JobTemplate.java。七、构建 JSON 脚本JSON 构建是 DataX Web 的核心交互之一README.md流程如下步骤一、步骤二选择第 6.1 节创建的数据源。JSON 构建目前支持的数据源有hive、mysql、oracle、postgresql、sqlserver、hbase、mongodb、clickhouse其它数据源的 JSON 构建仍在开发中暂时需要手动编写。字段映射选择读取字段与写入字段的映射关系。点击构建生成 JSON此时可选择复制 JSON 然后创建任务选择 DataX 任务将 JSON 粘贴到文本框也可以点击选择模板直接生成任务。JSON 构建的后端实现集中在 DataxJsonService 与 DataxJsonServiceImpl.java插件化设计位于tool/datax包读取插件tool/datax/readerMysqlReader、OracleReader、PostgresqlReader、SqlServerReader、HiveReader、HBaseReader、MongoDBReader、ClickHouseReader均继承 BaseReaderPlugin.java。写入插件tool/datax/writerMysqlWriter、OraclelWriter、PostgresqllWriter、SqlServerlWriter、HiveWriter、HBaseWriter、MongoDBWriter、ClickHouseWriter均继承 BaseWriterPlugin.java。统一的构建入口为 DataxJsonHelper.java其单元测试见 DataxJsonHelperTest.java。各数据源的类型元数据、查询建表语句、生成列的细节分布在tool/meta如 MySQLDatabaseMeta、OracleDatabaseMeta、HiveDatabaseMeta、ClickHouseDataBaseMeta 等与tool/query中构建 JSON 时会动态获取目标表结构与列信息。7.1 RDBMS JSON 构建的增强细节v2.1.2 对 RDBMS JSON 构建做了多项增强增加postSql支持并支持构建多个preSql、postSql。PostgreSql、SQLServer、Oracle 数据源 JSON 构建增加 schema name 选择。RDBMS 数据源增量抽取增加主键自增方式并优化页面参数配置。时间增量同步支持更多时间格式HIVE JSON 构建增加头尾选项参数。八、批量创建任务对 RDBMS 数据源可以选择数据源与表根据模板批量生成 DataX 同步任务README.md。批量构建由 DataXBatchJsonBuildDto.java 承载请求参数批量任务创建逻辑在 JobProjectController 与 JobInfoController 中暴露极大缩短了多表同步的配置时间。九、任务创建与调度策略9.1 支持的任务类型任务创建支持四种类型README.mdDataX 任务、Shell 任务、Python 任务、PowerShell 任务。其中 DataX 任务由 ExecutorJobHandler.javaJobHandler(value executorJobHandler)执行流程为根据 JSON 生成临时文件 → 拼接命令行并Runtime.exec启动进程 → 记录 DataX 进程号并回调调度中心 → 双线程分别解析标准输出与错误流 →process.waitFor()等待退出码0 表示成功。9.2 阻塞处理策略阻塞处理策略用于调度过于密集、执行器来不及处理时的取舍README.md单机串行调度请求进入单机执行器后进入 FIFO 队列并以串行方式运行丢弃后续调度发现执行器存在运行的调度任务时本次请求被丢弃并标记为失败覆盖之前调度发现执行器存在运行的调度任务时终止运行中的任务并清空队列然后运行本次调度任务。增量同步建议将阻塞策略设置为丢弃后续调度或单机串行。README 特别提醒设置单机串行时应合理设置重试次数遵循失败重试的次数 × 每次执行时间 任务调度周期。例如任务 30 秒执行一次、每次执行需要 20 秒、设置重试 3 次若任务失败第一个重试的时间段为 1577755680-1577756680重试任务未结束时新任务又开启新任务的时间段会是 1577755680-1577758680重试次数过多会导致数据重复README.md。9.3 超时、重试与告警任务增加超时时间对超时任务 kill datax 进程可配合重试策略避免网络问题导致的 DataX 卡死README.md。超时 kill 逻辑见 KillJob.java由 AdminBizImpl.java 在收到FAIL_TIMEOUT回调时触发。失败重试次数可自定义失败告警默认提供邮件方式并预留扩展接口。任务依赖支持子任务父任务执行成功后自动触发子任务执行AdminBizImpl.java 中对子任务回调的处理。9.4 任务列表与运行状态任务列表页面展示全部任务及其状态支持动态修改状态、启动/停止任务、终止运行中任务即时生效。任务实体为 JobInfo.java调度触发链路由 JobTrigger.java、TriggerTypeEnum.java 与调度线程池 JobTriggerPoolHelper.java 支撑。十、增量同步时间自增与主键自增增量同步是 DataX Web 最有价值的特性之一完整配置说明见 doc/datax-web/increment-desc.mdREADME 中以链接形式提供了 增量参数设置 与 分区参数设置。10.1 按日期增量抽取页面任务配置5 个步骤任务类型选DataX 任务辅助参数选择时间自增配置增量开始时间即 SQL 中查询时间的开始时间方便第一次全量同步。第一次同步完成后该时间被更新为上一次的任务触发时间任务失败不更新配置增量时间字段-DlastTime%s -DcurrentTime%s。解析如下increment-desc.md-D是 DataX 参数的标识符必配-D后面的lastTime、currentTime是 DataX JSON 中 where 条件的时间字段标识符必须与 JSON 中的变量名称保持一致%s是项目用于替换时间的占位符必配且格式必须完全一致注意-DlastTime%s与-DcurrentTime%s中间有一个空格空格必须保留且只能是一个空格配置时间格式可选择数据库中时间的格式也可通过 JSON 中配置 SQL 时间转换函数处理。JSON 配置示例节选自 increment-desc.md{ job: { setting: { speed: { channel: 16 } }, content: [ { reader: { name: mysqlreader, parameter: { splitPk: id, username: root, password: root, column: [*], connection: [ { jdbcUrl: [jdbc:mysql://localhost:3306/test?characterEncodingutf8], querySql: [ select * from test_list where operationDate FROM_UNIXTIME(${lastTime}) and operationDate FROM_UNIXTIME(${currentTime}) ] } ] } }, writer: { name: mysqlwriter, parameter: { username: root, password: 123456, column: [*], batchSize: 4096, connection: [ { jdbcUrl: jdbc:mysql://localhost:3307/test?characterEncodingutf8, table: [test_list] } ] } } } ] } }querySql 解析关键点在${lastTime}、${currentTime}${}是 DataX 动态参数的固定格式变量名必须与页面配置-D中的标识符一致。如果页面时间类型选择为时间戳而数据库时间格式不是时间戳例如2019-11-26 11:40:57可以用FROM_UNIXTIME(${lastTime})进行转换increment-desc.md。10.2 按自增主键增量抽取页面任务配置4 个步骤increment-desc.md任务类型选 DataX 任务辅助参数选择主键自增配置增量主键开始 ID即 SQL 中查询 ID 的开始 ID方便第一次全量同步。第一次同步完成后该 ID 被更新为上一次任务触发时最大的 ID任务失败不更新配置增量字段-DstartId%s -DendId%s-D为 DataX 参数标识符必配startId、endId是 JSON 中 where 条件的 id 字段标识符必须与 JSON 变量名一致endId是任务每次执行时获取的当前表 maxId也是下一次任务的startId%s是占位符格式必须完全一致两个-D参数间必须保留且仅有一个空格选择 reader 数据源并配置需要同步数据的表名及该表的主键。JSON 配置示例节选自 increment-desc.md{ job: { setting: { speed: { channel: 3, byte: 1048576 }, errorLimit: { record: 0, percentage: 0.02 } }, content: [ { reader: { name: mysqlreader, parameter: { username: yRjwDFuoPKlqya9h9H2Amg, password: yRjwDFuoPKlqya9h9H2Amg, splitPk: , connection: [ { querySql: [select * from job_log where id ${startId} and id ${endId}], jdbcUrl: [jdbc:mysql://localhost:3306/datax_web] } ] } }, writer: { name: mysqlwriter, parameter: { username: mCFDp1IMsa0rHicbQohcA, password: PhYxJmA/nuBJD1OxKTRzZH8sxuRddOv83hdqDOVRi0, column: [id, job_group, job_id, job_desc, executor_address, executor_handler, executor_param, executor_sharding_param, executor_fail_retry_count, trigger_time, trigger_code, trigger_msg, handle_time, handle_code, handle_msg, alarm_status, process_id, max_id], connection: [ { table: [job_log], jdbcUrl: jdbc:mysql://47.98.125.243:3306/datax_web } ] } } } ] } }注意示例中 reader 的用户名密码为密文AES 加密后写入 JSON执行 DataX 任务时由执行器解密。querySql 解析select * from job_log where id ${startId} and id ${endId}startId、endId对应页面配置-DstartId%s -DendId%s中的标识符。10.3 增量状态的持久化源码佐证增量游标更新由调度中心在回调阶段完成任务成功回调时AdminBizImpl.java 的updateIncrementParam方法根据增量类型调用主键自增jobInfoMapper.incrementIdUpdate(jobId, maxId)更新任务记录中的incStartId时间自增jobInfoMapper.incrementTimeUpdate(jobId, triggerTime)更新incStartTime。Mapper 定义见 JobInfoMapper.java。这正对应文档中第一次同步完成后时间/ID 被更新为上一次任务触发时间/最大 ID任务失败不更新的行为——因为游标只在成功回调路径上更新。参数拼接与替换的执行器实现位于 BuildCommand.java时间自增IncrementTypeEnum.TIME默认按 Timestamp 处理startTime 任务的增量开始时间/1000、endTime 触发时间/1000通过String.format(replaceParam, startTime, endTime)替换占位符若配置了时间格式replaceParamType则按SimpleDateFormat格式化后再替换。主键自增IncrementTypeEnum.IDstartId tgParam.getStartId()、endId tgParam.getEndId()同样通过占位符替换。JVM 参数与动态参数最终拼装进命令行数组python datax.py -j -Xms2G -Xmx2G -p -DlastTime... -DcurrentTime... datax.json见 BuildCommand.java。增量类型枚举定义在 datax-core 的 IncrementTypeEnum.java。十一、增量数据抽取到动态分区README 中 分区参数设置 给出了增量动态参数抽取数据到动态分区的完整方案通过动态参数配置指定 Hive 分区可配合增量实现增量数据动态插入分区。DataX JSON 配置要点节选自 partition-dynamic-param.mdreader 使用 mysqlreaderquerySql中updateTime FROM_UNIXTIME(${lastTime}) and operationDate FROM_UNIXTIME(${currentTime})writer 使用 hdfswriterpath写为/user/hive/warehouse/offline.db/test_order/${partition}即分区目录由动态参数${partition}决定${lastTime}增量开始时间定时任务启动后第一次的开始时间为页面输入时间任务执行成功后更新为上一次的任务触发时间任务失败不更新${currentTime}为任务触发时间分区字段${partition}为固定格式不能自定义拼接结果示例-p-DlastTime1572537600 -DcurrentTime1579317145 -Dpartitiondatety2020-01-18JVM 启动参数拼接结果-j -Xms2G -Xmx2G。DataX 启动命令partition-dynamic-param.mdpython datax.py -j -Xms2G -Xmx2G -p -DlastTime1577009172 -DcurrentTime1579317145 -Dpartitiondatety2020-01-18 datax.json从源码看分区参数由页面解析为分区字段,时间偏移,时间格式三段逗号分隔执行器在 BuildCommand.java 中按IncrementTypeEnum.PARTITION处理buildPartition取偏移量与格式通过DateUtil.addDays(new Date(), timeOffset)计算分区日期并拼接为字段日期值最终以-Dpartition...形式注入。十二、任务列表、运行日志与进程终止12.1 实时日志与执行结果统计任务列表页面支持点击查看日志、实时获取日志信息并可在页面终止正在执行的 DataX 进程README.md。日志页面还增加了 DataX 执行结果统计数据README.md该统计由执行器端的 AnalysisStatistics.java 解析 DataX 输出流计算得出并通过 ExecutorJobHandler.java 作为任务结果消息回传。12.2 日志线程模型ExecutorJobHandler.java 的日志处理模型标准输出用FutureTaskLogStatistics异步解析错误流单独起线程解析最终以退出码判断成败0 成功非 0 失败临时 JSON 文件在 finally 中删除。日志文件与进程的关联通过ProcessCallbackThread将 DataX 进程号回传调度中心供页面终止进程使用。12.3 超时任务 Kill调度中心对超时任务执行 kill datax 进程对应 README 第 31 条特性AdminBizImpl.java 在回调结果为FAIL_TIMEOUT且存在进程号时调用KillJob.trigger(...)主动终止。十三、执行器资源监控执行器支持 CPU、内存、负载的监控页面v2.1.2 起监控页面图形化README.md。监控数据来自执行器注册时上报的cpuUsage、memoryUsage、loadAverage见 AdminBizImpl.java采集端实现在 SystemUtils.java注册与心跳线程见 ExecutorRegistryThread.java。十四、用户管理与权限admin 可以创建用户、编辑用户信息README.md。系统支持管理员、普通用户两种角色README 第 14 条特性用户实体为 JobUser.java鉴权基于 JWT过滤器实现见 JWTAuthenticationFilter.java 与 JWTAuthorizationFilter.java令牌生成与校验见 JwtTokenUtils.java。十五、版本演进v2.1.2 与 v2.1.1README 末尾记录了最近的版本变更README.md可作为选型与升级依据v2.1.2 新增添加项目管理模块可对任务分类管理RDBMS 数据源批量任务创建功能选数据源、表按模板批量生成任务JSON 构建增加 ClickHouse 数据源支持执行器 CPU、内存、负载监控页面图形化RDBMS 增量抽取增加主键自增方式并优化页面参数配置更换 MongoDB 数据源连接方式重构 HBase 数据源 JSON 构建模块脚本类型任务增加停止功能rdbms json 构建增加 postSql支持构建多个 preSql、postSql合并 datax-registry 模块到 datax-rpc 中数据源信息加密算法修改及代码优化时间增量同步支持更多时间格式日志页面增加 DataX 执行结果统计数据。v2.1.2 升级PostgreSql、SQLServer、Oracle 数据源 JSON 构建增加 schema name 选择DataX JSON 字段名称与数据源关键词一致问题优化任务管理页面按钮展示优化日志管理页面增加任务描述信息JSON 构建前端 form 表单不能缓存数据问题修复HIVE JSON 构建增加头尾选项参数。升级备注2.1.1 版本不建议直接升级——数据源信息加密方式变更会导致之前已加密的数据源解密失败、任务运行失败如需升级请重建数据源与任务README.md。v2.1.1 新增HBase 数据源支持JSON 构建可通过 HBase 数据源获取 hbaseConfig、columnMongoDB 数据源支持仅需选择 collectionName 即可完成 JSON 构建执行器 CPU、内存、负载监控页面24 类插件 DataX JSON 配置样例公共字段创建时间、创建人、修改时间、修改者自动填充swagger 接口 token 验证任务超时时间设置超时 kill datax 进程可配合重试策略避免网络问题导致的 DataX 卡死。v2.1.1 升级与修复数据源管理对用户名和密码加密提高安全性JSON 文件中的用户名密码加密执行时解密页面菜单整理、图标升级、提示信息优化日志输出取消项目类名等无关信息减小文件大小优化大文件输出与页面展示logback 改为从 yml 获取日志路径配置修复任务日志过大时查看日志报错、请求超时的问题。十六、开源协议与社区DataX Web 采用 MIT LicenseCopyright (c) 2020 WeiYe产品开源免费并提供持续的社区技术支持个人或企业内部可自由接入和使用README.md。项目欢迎贡献可提交 Pull Request 修复 bug或新建 Issue 讨论新特性与变更README.md。前端工程为独立的 datax-web-ui 项目。结语DataX Web 的定位非常清晰把 DataX 从手工编写 JSON 命令行执行升级为页面勾选 集中调度 分布式执行 可视化监控的完整链路。从 README 的 41 项特性到本文对照的源码实现可以看到它在数据源插件化、JSON 构建、增量游标持久化、超时 Kill、执行器自动注册与资源上报等方面都已形成闭环。若需进一步深入建议依次阅读 userGuid.md、doc/datax-web/datax-web-deploy.md、doc/datax-web/increment-desc.md 与 doc/datax-web/partition-dynamic-param.md并结合 datax-admin 与 datax-executor 源码验证文中各条调用链。赞分享数据集成数据同步任务调度后端【免费下载链接】datax-webDataX集成可视化页面选择数据源即可一键生成数据同步任务支持RDBMS、Hive、HBase、ClickHouse、MongoDB等数据源批量创建RDBMS数据同步任务集成开源调度系统支持分布式、增量同步数据、实时查看运行日志、监控执行器资源、KILL运行进程、数据源信息加密等。项目地址https://gitcode.com/gh_mirrors/da/datax-web点击查看免费下载相关推荐DataX 分区同步实战基于 datax-web 的动态分区参数配置与调度实现DataX 分区同步实战基于 datax web 的动态分区参数配置与调度实现 本文围绕 datax web 仓库中的分区同步方案文档 partition数据集成数据同步任务调度后端MediaFusion核心功能详解从多源聚合到个性化流媒体体验MediaFusion核心功能详解从多源聚合到个性化流媒体体验 MediaFusion是一款终极开源流媒体平台通过多源内容聚合与智能个性化推荐为用户打造无python-OBD命令集详解PIDs、解码器与单位转换实用手册python OBD命令集详解PIDs、解码器与单位转换实用手册 python OBD是一个强大的OBD II串行模块用于读取发动机数据。本文将为你全面解析物联网智能硬件上一篇PaddleOCR Android 部署实战基于 ONNX Runtime 的 PP-OCRv6 移动端 SDK 集成指南下一篇MkDocs Material 多语言配置实战站点语言、语言选择器与自定义翻译创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑