Yandex allibero el codi font de YTsaurus

YTsaurus

YTsaurus és una plataforma de processament i emmagatzematge distribuït per a big data amb suport per al model MapReduce

Fa alguns dies Yandex va donar a conèixer mitjançant un anunciar l'obertura del codi font de la plataforma YTsauru, la qual és utilitzada per a l'emmagatzematge distribuït i el processament de grans quantitats de dades, que admet la manipulació de dades utilitzant el paradigma MapReduce, el motor de consultes SQL, el sistema d'arxius distribuïts i l'emmagatzematge NoSQL en format clau-valor.

YTsaurus s'utilitza a la infraestructura de Yandex per utilitzar de manera eficient la potència informàtica de les supercomputadores de l'empresa. La plataforma pot escalar a clústers de més de 10.000 nodes, cobrint fins a un milió de processadors i milers de GPU (per a tasques d'aprenentatge automàtic).

Els contenidors aïllats que s'executen en servidors físics es poden utilitzar com a unitats de clúster. L'emmagatzematge pot contenir exabytes de dades ubicats en diversos mitjans, com ara discs durs, SSD, NVME i RAM.

El clúster admet l'addició i l'eliminació dinàmica de nodes, redundància (sense punt únic de falla), replicació automàtica, actualitzacions de programari de clúster actives i recuperació de redundància automàtica en cas de falla del node.

S'admeten tres tipus de clústers: clústers de còmput (per al processament paral·lel massiu de macrodades mitjançant operacions de MapReduce), clústers per a taules dinàmiques i emmagatzematge de clau-valor, i clústers distribuïts geogràficament.

Un servei basat en plataforma pot proporcionar els mitjans per emmagatzemar i processar dades de desenes de milers dusuaris. Entre les aplicacions típiques de YTsaurus a Yandex hi ha l'emmagatzematge d'informació sobre els usuaris de la xarxa publicitària, l'entrenament de models d'aprenentatge automàtic, la formació d'un índex de cerca i la construcció d'un magatzem de dades per a serveis com ara Yandex Taxi , Food, Lavka i entregues

Dels casos d'ús bàsics se n'esmenta:

  • Processament per lots: MapReduce i SPYT (Apache Spark com a motor informàtic sobre dades a YTsaurus) per al processament de dades estructurades i semiestructurades: registres o transaccions financeres.
  • Anàlisi ad hoc: Consultes ràpides a través de CHYT (un grup de servidors ClickHouse en nodes informàtics de YTsaurus) sense copiar dades en un sistema analític separat. ODBC i JDBC amb la capacitat de connectar BI per a visualització.
  • Tasques OLTP: Treball transaccional en temps real amb emmagatzematge de clau-valor: per exemple, emmagatzematge de perfils dusuari, visualització danuncis o processament de transmissió.
  • Aprenentatge automàtic: Administreu clústers de GPU per entrenar models amb milers de milions de paràmetres.
  • Emmagatzematge de metainformació: Emmagatzematge transaccional de metainformació i servei fiable de bloquejos distribuïts.
  • Creació de magatzems de dades i ETL per al processament de dades de diversos nivells utilitzant eines típiques: Apache Spark, SQL, MapReduce.

Mentre que per part dels principals elements de l'arquitectura, s'esmenten els següents:

  • Sistema de fitxers distribuït i emmagatzematge de metainformació en forma d'arbre tolerant a falles de Cypress.
  • Scheduler per a computació distribuïda amb suport per al model MapReduce, així com operacions bàsiques avançades.
  • Escalabilitat horitzontal de les operacions informàtiques.
  • Aïllament dels recursos informàtics i la possibilitat d'assignar determinats recursos informàtics (CPU, GPU, RAM) en diferents proporcions.
  • Taules dinàmiques per crear emmagatzematge OLTP, compatibilitat amb emmagatzematge basat en MVCC, transaccions, la capacitat d'eliminar dades després del venciment i cues de missatges per al processament de dades de transmissió sobre taules dinàmiques.
  • API i llibreries per a llenguatges de programació C++, Python, Java, Go.
  • Una interfície web per a usuaris i administradors que admet la navegació mitjançant un emmagatzematge en forma d'arbre.

Finalment si estàs interessat en poder conèixer-ne més , has de saber que el codi del projecte està escrit en C/C++ i està obert sota la llicència Apache 2.0. Pots consultar els detalls al següent enllaç.

El repositori de GitHub conté el codi del servidor per a YTsaurus, la infraestructura d'implementació que utilitza k8s, una interfície web per al sistema i SDK de client per a llenguatges de programació populars com C++, Java, Go i Python.


Afegir com a font preferida a Google