Skip to content

Release v5.1.0

Latest

Choose a tag to compare

@baisui1981 baisui1981 released this 20 Aug 10:36

Abstract

TIS v5.1.0 版本主要功能说明

1. ChatBI — 基于 Ontology 语义层的智能数据问答

TIS v5.1.0 推出了面向业务人员的自然语言数据查询能力 ChatBI。该功能建立在全新的 Ontology 语义层之上,通过对数据源进行语义化建模(对象类型、属性、业务术语、关系连接等),将技术表结构转化为业务人员可理解的知识图谱。系统采用 GraphRAG 技术从 Neo4j 中高效召回相关语义子图,并经由 NL→SQL 链路生成可执行 SQL,配合关键字白名单、AST 语法校验及 EXPLAIN 动态校验三重安全机制,确保生成 SQL 的正确性与安全性。业务人员无需掌握 SQL 或了解底层表结构,即可通过对话方式自助获取数据洞察,大幅降低数据分析门槛。

2. DAG 批量调度引擎全面迁移至 Akka Actor 架构

为提升大规模数据同步任务的调度性能与系统可靠性,TIS v5.1.0 将批量同步调度核心从传统模式全面重构为基于 Akka Actor 的分布式架构。通过引入 WorkflowInstanceActor 有状态实例管理,消除重复数据库查询与 DAG 重复计算;利用 Cluster Sharding 实现自动路由与故障恢复,结合 NodeDispatcherActor 的并发控制机制,避免大量任务同时执行对源端数据库造成压力。架构精简后去除冗余转发层,消息延迟降低约 10-20%,并原生支持集群动态扩缩容与任务自动故障转移。

3. Flink-CDC Pipeline 支持 before/after 双版本数据

针对实时变更数据捕获场景,v5.1.0 引入 Flink-CDC Pipeline 模式。在此前的 MySQL CDC 同步到 Kafka 的实现中,消息仅包含变更后的 after 版本数据,无法满足审计追踪、数据比对及增量分析等场景对变更前状态的需求。新版本通过 PipelineEventSinkFunc 将变更事件映射为包含 before 与 after 双版本的完整事件流,使下游消费方能够同时获取数据修改前后的完整快照,显著扩展了 CDC 数据在审计、对账、实时分析等场景中的应用价值。

4. 多实体实例批量删除能力

为提升运维效率,v5.1.0 统一了前端各类列表的批量删除操作机制。通过引入 ListItemsManager 抽象基类,将“选择目标记录 → 执行删除 → 反馈结果”的流程标准化,并以插件化方式扩展至不同实体类型。目前已支持构建历史记录、Ontology Glossary 业务术语等多种资源的批量删除。该机制避免了为每种实体重复开发删除逻辑,后续新增实体仅需继承基类即可快速接入统一的批量删除能力。

5. Paimon FileSystem Catalog — 轻量级数据湖接入

在 Paimon 数据湖支持方面,v5.1.0 新增了 FileSystemCatalog 实现,使用户能够直接基于 MinIO、HDFS 等底层文件系统创建和管理 Paimon 表,无需再依赖 HiveServer2 及 Hive Metastore 服务。相比此前仅支持的 HiveCatalog,FileSystemCatalog 大幅简化了部署依赖,降低了生产环境的运维复杂度,特别适用于已采用对象存储作为数据湖底座、希望减少组件依赖的轻量化场景,进一步拓宽了 TIS 在云原生数据湖架构中的适配范围。

Others

  • 升级TIS的jdk 版本到17#488

New Feature

  • 建议新增数据同步到paimon支持S3、OSS#490
  • 建议新增功能:删除批量构建的任务。#487
  • 去除PowerJob组件依赖,启用akka#486
  • 提交大模型json描述需要改成json schema#485
  • 将kafka的sink端实现改成flink-cdc pipeline event消息实现#484
  • 基于TIS transformer的主表与维表的宽表构建#483
  • 废弃DataxAddStep6Component tableAlias设置#481

Bug Fix

  • 人大金仓数据库V9 mysql兼容版 同步到Doris4.0.2#492
  • 使用KubernetesApplication模式部署flink job 执行stop之后无法通过保存的savepoint恢复job任务#464

Installation

Related Projects