从多源异构数据的统一汇聚,到多维度的深度分析与洞察提炼—— 构建采集到分析之间的高效流转,打通数据价值的端到端链路。
灵活、可靠地从异构数据源获取数据,为后续分析提供高质量原料
支持关系型数据库、NoSQL、消息队列、REST API、日志文件、CSV 等 20+ 种数据源,提供一致的采集接入层。
支持全量、增量、定时与事件触发四种模式,可灵活定义采集频率、分页策略与重试机制。
涵盖去重、缺失值处理、格式标准化等核心 ETL 流程,配合自定义转换规则,确保入库数据质量。
基于时间戳或游标的增量采集,任务中断后可自动恢复,避免重复抽取与数据遗漏。
对接 Kafka、MQTT 等流数据源,支持毫秒级数据接入,适用于监控、日志等实时场景。
支持任务间依赖编排、并行度控制与周期调度,采集全流程可追踪、可回溯。
从原始数据中提炼洞察,涵盖交叉分析、趋势判断、异常发现与归因定位
支持按任意维度组合进行聚合、下钻与对比,快速发现不同维度下的数据差异与规律。
均值、中位数、标准差、分位数等描述统计量,结合移动平均与周期对比,追踪数据变化趋势。
基于阈值规则、波动率与统计模型,自动识别离群点与异常波动,辅助快速定位问题根因。
计算多指标间的相关系数,结合时间偏移分析,挖掘指标变化的深层原因和传导链条。
支持 A/B 对比、时间段对比与分群对比,量化实验效果与策略变更对核心指标的实际影响。
支持按任意指标进行 Top-N 排序、等距/等频分组与排名分析,快速筛选头部数据与异常分段。
轻量、灵活、可扩展,适配各类数据采集与分析场景
单一可执行文件,零运行时依赖,开箱即用。支持 Linux、macOS、Windows 全平台。
采集与分析任务通过 YAML 声明式定义,可纳入版本控制,无缝融入团队协作与 CI/CD 流程。
数据源适配与分析模块均以插件形式加载,按需启用;同时开放插件接口,支持自定义扩展。
提供 RESTful API,支持将采集与分析能力嵌入现有数据管道,与常见 ETL 及 BI 工具对接。
基于 MIT 协议开源,欢迎通过 GitHub 或留言板分享你的想法,每一条反馈都可能成为下一次更新的灵感。
代码仅供学习交流,不作商业用途。基于它的二次开发请自行评估风险,与本人无关。有任何想法或建议,欢迎随时交流。
GitHub