🎉 CloudCanal 上线 V6.1.0.0：KingbaseES 分区表迁移性能大幅提升

跳到主要内容

Aurora for MySQL 到 Iceberg

CloudCanal 支持从 Aurora for MySQL 到 Iceberg 的数据迁移、同步、校验和链路能力。

选择对端数据库：

Iceberg

数据链路

基本功能

功能	说明
结构迁移	如目标不存在所选表，则自动根据源端元数据，结合映射生成对端创建语句并执行创建
全量数据迁移	逻辑迁移，通过顺序扫描表数据，将数据分批写入到对端数据库
增量实时同步	支持 INSERT, UPDATE, DELETE 常见 DML 同步无主键表 UPDATE, DELETE 不同步（需手动勾选）
修改订阅	新增、删除、修改订阅表，支持历史数据迁移，文档：修改订阅
重置位点	支持按照文件位点、时间戳回溯位点，重新消费过去一段时间或指定 Binlog 文件和位点开始的增量日志
表名映射	支持和源端保持一致, 转小写, 转大写, 以'_数字'后缀截取
DDL 同步	ALTER TABLE ADD COLUMN, DROP COLUMN, MODIFY COLUMN, CHANGE COLUMN
元数据检索	从源端表查对端，查询设置过过滤条件的，查询设置过对端主键的

高级功能

功能	说明
写入冲突策略	源端有主键表进行覆盖写入，源端无主键表进行追加写入
自定义表属性	包括 format-version 等属性设置
设置数据分区	创建任务时，可按表粒度指定分区定义（静态或动态），结构迁移时自动添加该分区定义
自定义代码	文档1：创建自定义代码任务文档2：自定义代码任务 debug 文档3：在自定义代码中打日志
设置目标主键	变更主键为其他字段，方便数据聚合等操作
数据过滤条件	支持 WHERE 条件进行数据过滤，内容为 SQL 92 子集，文档：创建数据过滤任务

限制和注意点

限制项	说明
MySQL 存储引擎	支持 InnoDB, MySIAM, 阿里云 XEngine, 其他存储引擎暂未测试
MySQL 字符集	支持 utf8, utf8mb4, latin1, 其他编码暂未测试

链路FAQ

MySQL 任务延迟怎么办?
MySQL 源端找不到 binlog 文件
如何打开 MySQL 源端心跳?
MySQL 源端 Schema 权限报错怎么办?

Tips: MySQL 源端相关 FAQ 同样适用于 MySQL 系数据源。

源端数据源

前置条件

条件	说明
账号权限	文档：MySQL / MariaDB 需要的权限
开启 Binlog	[mysqld] log-bin=mysql-bin # 开启 Binlog binlog-format=ROW # 选择 ROW 模式 binlog_row_image=FULL # 变更带所有列数据

任务参数

参数名称	说明
parseBinlogParallel	增量解析 Binlog 的并发数
parseBinlogBufferSize	用于增量解析 Binlog 的环形队列大小
maxTransactionSize	单事务最大数据条数，超过则分段刷出
limitThroughputMb	限制增量 Binlog 流量
extraDDL	兼容额外的 DDL 同步，包括 PT, GHOST, ALI_DMS, PT_GHOST
fullDataSqlConditionEnabled	将过滤条件拼入 SQL 中进行源端数据扫描，此参数只针对全量迁移有效
srcTimeZone	源端时区，例如 +08:00, Asia/Shanghai, America/New_York 等

Tips: 通用参数配置请参考通用参数及功能

目标端数据源

前置条件

条件	说明
网络准备	迁移同步节点（sidecar）可连接 Catalog 和文件存储
Nessie 数据源配置模版	网络地址（CatalogUri）: ip:19120/api/v1 catalogName: nessie catalogType: NESSIE catalogWarehouse: s3://warehouse catalogProps: { "io-impl": "org.apache.iceberg.aws.s3.S3FileIO", "s3.endpoint": "http://ip:9000", "s3.access-key-id": "admin", "s3.secret-access-key": "password", "s3.path-style-access": "true", "client.region": "ap-southeast-1" }
Glue 数据源配置模版	网络地址（CatalogUri）: glue.ap-southeast-1.amazonaws.com httpsEnabled: true catalogName: glue_catalog catalogType: GLUE catalogWarehouse : s3://warehouse catalogProps: { "io-impl": "org.apache.iceberg.aws.s3.S3FileIO", "s3.endpoint": "https://s3.ap-southeast-1.amazonaws.com", "s3.access-key-id": "", "s3.secret-access-key": "", "s3.path-style-access": "true", "client.region": "ap-southeast-1", "client.credentials-provider.glue.access-key-id": "", "client.credentials-provider.glue.secret-access-key": "", "client.credentials-provider": "com.amazonaws.glue.catalog.credentials.GlueAwsCredentialsProvider" }
REST 数据源配置模版	网络地址（CatalogUri）: ip :8181 httpsEnabled: false catalogName: rest_catalog catalogType: REST catalogWarehouse : s3://warehouse catalogProps: { "io-impl": "org.apache.iceberg.aws.s3.S3FileIO", "s3.endpoint": "http://ip:9000", "s3.access-key-id": "admin", "s3.secret-access-key": "password", "s3.path-style-access": "true", "client.region": "us-east-1" }

任务参数

参数名称	说明
fileFormat	写入文件格式（parquet / orc / ... ）
writeTargetFileSizeMb	写入目标文件大小（MB）
writeProps	写入配置参数（Json 格式）
commitBranch	写入提交的分支
totalDataInMemMb	攒批写入，内存中最大数据容量，超过此容量或超过 asyncFlushIntervalSec 则刷出数据到写入队列
asyncFlushIntervalSec	攒批写入，等待刷出的间隔时间，超过此时间或超过 totalDataInMemMb 则刷出数据到写入队列
flushBatchMb	单表最大攒批容量，超过此容量则刷出数据到写入队列
realFlushPauseSec	刷出数据到 Iceberg 的等待时间，0 则不等待

Tips: 通用参数配置请参考通用参数及功能

联系我们

微信二维码

扫码添加微信，获取技术支持