ইয়ানডেক্স YTsaurus এর সোর্স কোড প্রকাশ করেছে

YTsaurus

YTsaurus হল MapReduce মডেলের সমর্থন সহ বড় ডেটার জন্য একটি বিতরণ করা স্টোরেজ এবং প্রক্রিয়াকরণ প্ল্যাটফর্ম।

কিছু দিন আগে ইয়ানডেক্স উন্মোচন করেছে একটি ঘোষণা মাধ্যমে YTsauru প্ল্যাটফর্মের সোর্স কোড খোলা, যা ডিস্ট্রিবিউটেড স্টোরেজ এবং প্রচুর পরিমাণে ডেটা প্রক্রিয়াকরণের জন্য ব্যবহৃত হয়, যা MapReduce প্যারাডাইম, SQL ক্যোয়ারী ইঞ্জিন, ডিস্ট্রিবিউটেড ফাইল সিস্টেম এবং কী-ভ্যালু ফরম্যাটে NoSQL স্টোরেজ ব্যবহার করে ডেটা ম্যানিপুলেশন সমর্থন করে।

YTsaurus ব্যবহৃত ইয়ানডেক্স অবকাঠামোতে সুপার কম্পিউটারের কম্পিউটিং শক্তি দক্ষতার সাথে ব্যবহার করতে কোম্পানির প্ল্যাটফর্মটি 10-এর বেশি নোডের ক্লাস্টারে স্কেল করতে পারে, যা এক মিলিয়ন পর্যন্ত প্রসেসর এবং হাজার হাজার GPUs (মেশিন লার্নিং কাজের জন্য) কভার করে।

ভৌত সার্ভারে চলমান বিচ্ছিন্ন পাত্রগুলি ক্লাস্টার ইউনিট হিসাবে ব্যবহার করা যেতে পারে। সঞ্চয়স্থানে বিভিন্ন মিডিয়া যেমন হার্ড ড্রাইভ, এসএসডি, এনভিএমই এবং র‌্যামের মতো এক্সাবাইট ডেটা থাকতে পারে।

ক্লাস্টারটি নোডের গতিশীল সংযোজন এবং অপসারণ, রিডানডেন্সি (ব্যর্থতার একক পয়েন্ট নেই), স্বয়ংক্রিয় প্রতিলিপি, সক্রিয় ক্লাস্টার সফ্টওয়্যার আপগ্রেড এবং নোড ব্যর্থতার ক্ষেত্রে স্বয়ংক্রিয় রিডানডেন্সি পুনরুদ্ধার সমর্থন করে।

তিন ধরনের ক্লাস্টার সমর্থিত: কম্পিউট ক্লাস্টার (MapReduce অপারেশন ব্যবহার করে বড় ডেটার ব্যাপক সমান্তরাল প্রক্রিয়াকরণের জন্য), পিভট টেবিল এবং কী-ভ্যালু স্টোরেজের জন্য ক্লাস্টার এবং ভৌগলিকভাবে বিতরণ করা ক্লাস্টার।

একটি প্ল্যাটফর্ম-ভিত্তিক পরিষেবা হাজার হাজার ব্যবহারকারীর জন্য ডেটা সংরক্ষণ এবং প্রক্রিয়া করার উপায় সরবরাহ করতে পারে। ইয়ানডেক্সের সাধারণ YTsaurus অ্যাপ্লিকেশনগুলির মধ্যে রয়েছে বিজ্ঞাপন নেটওয়ার্ক ব্যবহারকারীদের সম্পর্কে তথ্য সংরক্ষণ করা, মেশিন লার্নিং মডেল প্রশিক্ষণ দেওয়া, একটি অনুসন্ধান সূচক তৈরি করা এবং Yandex ট্যাক্সির মতো পরিষেবার জন্য একটি ডেটা গুদাম তৈরি করা। , খাদ্য, লাভকা এবং ডেলিভারি।

মৌলিক ব্যবহারের ক্ষেত্রে এটি উল্লেখ করা হয়েছে:

  • ধির গতির কাজ: MapReduce এবং SPYT (YTsaurus-এ ডেটার উপর একটি কম্পিউটিং ইঞ্জিন হিসাবে অ্যাপাচি স্পার্ক) কাঠামোগত এবং আধা-কাঠামোগত ডেটা প্রক্রিয়াকরণের জন্য: রেকর্ড বা আর্থিক লেনদেন।
  • অ্যাডহক বিশ্লেষণ: একটি পৃথক বিশ্লেষণ সিস্টেমে ডেটা অনুলিপি না করে CHYT (YTsaurus কম্পিউট নোডগুলিতে ক্লিকহাউস সার্ভারগুলির একটি গ্রুপ) এর মাধ্যমে দ্রুত প্রশ্নগুলি। ভিজ্যুয়ালাইজেশনের জন্য BI সংযোগ করার ক্ষমতা সহ ODBC এবং JDBC।
  • OLTP কাজ: মূল-মূল্য সঞ্চয়স্থানের সাথে রিয়েল-টাইম লেনদেনের কাজ: উদাহরণস্বরূপ, ব্যবহারকারীর প্রোফাইল স্টোরেজ, বিজ্ঞাপন প্রদর্শন বা স্ট্রিম প্রক্রিয়াকরণ।
  • মেশিন লার্নিং: বিলিয়ন প্যারামিটার সহ মডেলগুলিকে প্রশিক্ষণ দিতে GPU ক্লাস্টারগুলি পরিচালনা করুন৷
  • মেটা তথ্য স্টোরেজ: মেটানফর্মেশনের লেনদেনমূলক স্টোরেজ এবং বিতরণ করা লকগুলির নির্ভরযোগ্য পরিষেবা।
  • সাধারণ সরঞ্জামগুলি ব্যবহার করে বহু-স্তরের ডেটা প্রক্রিয়াকরণের জন্য ডেটা গুদাম এবং ETL তৈরি করা: Apache Spark, SQL, MapReduce।

স্থাপত্যের প্রধান উপাদানগুলির অংশে, নিম্নলিখিতগুলি উল্লেখ করা হয়েছে:

  • বিতরণ করা ফাইল সিস্টেম এবং সাইপ্রেস ফল্ট-সহনশীল গাছ-ভিত্তিক মেটানফরমেশন স্টোরেজ।
  • MapReduce মডেলের জন্য সমর্থন সহ ডিস্ট্রিবিউটেড কম্পিউটিংয়ের সময়সূচী, সেইসাথে উন্নত মৌলিক অপারেশন।
  • আইটি অপারেশনের অনুভূমিক মাপযোগ্যতা।
  • কম্পিউটিং সংস্থানগুলির বিচ্ছিন্নতা এবং বিভিন্ন অনুপাতে নির্দিষ্ট কম্পিউটিং সংস্থান (সিপিইউ, জিপিইউ, র‌্যাম) বরাদ্দ করার সম্ভাবনা।
  • OLTP স্টোরেজ তৈরির জন্য PivotTables, MVCC-ভিত্তিক স্টোরেজের জন্য সমর্থন, লেনদেন, মেয়াদ শেষ হওয়ার পরে ডেটা মুছে ফেলার ক্ষমতা এবং PivotTables-এ ডেটা প্রসেসিং স্ট্রিম করার জন্য বার্তা সারি।
  • প্রোগ্রামিং ভাষার জন্য API এবং লাইব্রেরি C++, Python, Java, Go।
  • ব্যবহারকারী এবং প্রশাসকদের জন্য একটি ওয়েব ইন্টারফেস যা গাছের মতো স্টোরেজের মাধ্যমে নেভিগেশন সমর্থন করে।

পরিশেষে আপনি যদি এটি সম্পর্কে আরও জানতে আগ্রহী হন, আপনার জানা উচিত যে প্রকল্পের কোডটি C/C++ এ লেখা এবং Apache 2.0 লাইসেন্সের অধীনে খোলা। আপনি বিস্তারিত চেক করতে পারেন নিম্নলিখিত লিঙ্ক.

El গিটহাবের সংগ্রহশালা ory YTsaurus-এর সার্ভার কোড, k8s দ্বারা ব্যবহৃত স্থাপনার কাঠামো, সিস্টেমে একটি ওয়েব ইন্টারফেস এবং C++, Java, Go এবং Python-এর মতো জনপ্রিয় প্রোগ্রামিং ভাষার জন্য ক্লায়েন্ট SDK গুলি রয়েছে। 


Google-এ পছন্দের উৎস হিসেবে যোগ করুন