Yandex 发布了 YTsaurus 的源代码

金牛座

YTsaurus 是一个分布式大数据存储和处理平台,支持 MapReduce 模型。

几天前 Yandex 亮相 通过一个宣布 YTsauru平台源代码开放, 用于大量数据的分布式存储和处理,支持使用MapReduce范式、SQL查询引擎、分布式文件系统和键值格式的NoSQL存储进行数据操作。

金牛座 用过的 在 Yandex 基础设施上 有效利用超级计算机的计算能力 该公司的该平台可以扩展到超过 10 个节点的集群,覆盖多达一百万个处理器和数千个 GPU(用于机器学习任务)。

在物理服务器上运行的隔离容器可以用作集群单元。 存储可以包含位于各种介质(例如硬盘驱动器、SSD、NVME 和 RAM)上的 EB 级数据。

集群支持动态增删节点、冗余(无单点故障)、自动复制、主动集群软件升级、节点故障自动冗余恢复。

支持三种类型的集群: 计算集群(用于使用 MapReduce 操作对大数据进行大规模并行处理)、数据透视表和键值存储集群以及地理分布式集群。

基于平台的服务可以为数以万计的用户提供存储和处理数据的方法。 Yandex 中典型的 YTsaurus 应用包括存储有关广告网络用户的信息、训练机器学习模型、形成搜索索引以及为 Yandex 出租车、食品、Lavka 和交付等服务构建数据仓库

在提到的基本用例中:

  • 批量处理: MapReduce 和 SPYT(Apache Spark 作为 YTsaurus 中数据的计算引擎)用于处理结构化和半结构化数据:记录或金融交易。
  • 临时分析: 通过 CHYT(YTsaurus 计算节点上的一组 ClickHouse 服务器)进行快速查询,无需将数据复制到单独的分析系统。 ODBC 和 JDBC 具有连接 BI 进行可视化的能力。
  • 联机事务处理任务: 使用键值存储的实时事务工作:例如,用户配置文件存储、广告显示或流处理。
  • 机器学习: 管理 GPU 集群以训练具有数十亿参数的模型。
  • 元信息存储: 元信息的事务存储和分布式锁的可靠服务。
  • 使用典型工具为多层数据处理创建数据仓库和 ETL:Apache Spark、SQL、MapReduce。

在架构的主要元素方面,提到了以下内容:

  • 分布式文件系统和赛普拉斯基于容错树的元信息存储。
  • 支持 MapReduce 模型以及高级基本操作的分布式计算调度程序。
  • IT 运营的横向可扩展性。
  • 计算资源隔离,可以按不同比例分配某些计算资源(CPU、GPU、RAM)。
  • 用于创建 OLTP 存储的数据透视表,支持基于 MVCC 的存储、事务、过期后删除数据的能力,以及用于通过数据透视表进行流式数据处理的消息队列。
  • 编程语言 C++、Python、Java、Go 的 API 和库。
  • 支持通过树状存储导航的用户和管理员的 Web 界面。

最后 如果您有兴趣了解更多有关它的信息,你应该知道该项目的代码是用 C/C++ 编写的,并在 Apache 2.0 许可下开放。 您可以查看详细信息 以下链接。

El GitHub资料库 包含 YTsaurus 的服务器代码、k8s 使用的部署框架、系统的 Web 界面以及流行编程语言(如 C++、Java、Go 和 Python)的客户端 SDK。 


在 Google 中将其添加为首选来源