分布式 SQL 查询
提供完全分布式的 SQL 查询处理引擎,支持面向大数据集的查询执行。
Apache Tajo:面向 Hadoop 的大数据仓库系统Tajo 是 Apache Hadoop 生态中的关系型与分布式数据仓库系统,面向存储在 HDFS 及其他数据源中的大型数据集,支持低延迟可扩展的即席查询、在线聚合和 ETL。项目页面显示 Tajo 已退休,现有资料主要用于文档、版本和源代码查阅。
Tajo 结合 SQL 标准、分布式执行和查询优化技术,提供面向 Hadoop 数据的查询、分析、数据格式兼容及开发接口。
提供完全分布式的 SQL 查询处理引擎,支持面向大数据集的查询执行。
支持基于成本的查询优化和渐进式查询优化,并提供多种查询评估与数据流策略。
支持长时间运行查询的容错和动态调度,并提供适用于超出内存容量数据集的外存算法。
支持 ANSI/ISO SQL 标准、Hive MetaStore 访问和 JDBC 驱动。
支持 CSV、JSON、RCFile、SequenceFile、ORC 和 Parquet 等文件格式。
提供用户自定义函数、交互式 Shell、备份恢复工具,以及异步和同步 Java API。
页面列出 Tajo 历史版本及对应的公告和发布说明;项目当前已退休。
页面列出 Tajo 0.11.3 版本,并提供公告和发布说明入口。
页面列出 Tajo 0.11.2 版本,并提供公告和发布说明入口。
页面列出 Tajo 0.11.1 版本,并提供公告和发布说明入口。
通过官方页面可查阅入门指南、当前文档、下载内容、源代码和项目协作资料。