მოხარულნი ვართ გაცნობოთ, რომ ცოტა ხნის წინ დავამატეთ კიდევ ერთი ფუნქცია, რომელიც დაგეხმარებათ ჰაბზე არსებული მონაცემთა ნაკრებების ანალიზში; თქვენ შეგიძლიათ SQL მოთხოვნების გაშვება DuckDB-ის გამოყენებით ჰაბზე შენახულ ნებისმიერ მონაცემთა ნაკრებზე! 2022 წლის StackOverflow დეველოპერთა გამოკითხვის მიხედვით, SQL არის პოპულარობით მე-3 პროგრამირების ენა. ჩვენ ასევე გვსურდა სწრაფი მონაცემთა ბაზის მართვის სისტემა (DBMS), რომელიც შექმნილია ანალიტიკური მოთხოვნების გასაშვებად, რის გამოც აღფრთოვანებულნი ვართ DuckDB-სთან ინტეგრაციით. ვიმედოვნებთ, რომ ეს საშუალებას მისცემს კიდევ უფრო მეტ მომხმარებელს, მიიღონ წვდომა და გააანალიზონ მონაცემთა ნაკრებები ჰაბზე! მონაცემთა ნაკრების დამთვალიერებელი ავტომატურად გარდაქმნის ჰაბზე არსებულ ყველა საჯარო მონაცემთა ნაკრებს Parquet ფაილებად, რომელთა ნახვაც შეგიძლიათ მონაცემთა ნაკრების გვერდის ზედა ნაწილში არსებულ ღილაკზე „ავტომატურად გარდაიქმნა Parquet-ად“ დაჭერით. ასევე შეგიძლიათ მიიღოთ Parquet ფაილების URL-ების სია მარტივი HTTP ზარით. შექმენით კავშირი DuckDB-სთან და დააინსტალირეთ და ჩატვირთეთ httpfs გაფართოება დისტანციური ფაილების წაკითხვისა და ჩაწერის ნებართვის მისაცემად. დაკავშირების შემდეგ, შეგიძლიათ დაიწყოთ SQL მოთხოვნების წერა! მეტის გასაგებად, გაეცანით დოკუმენტაციას. Parquet ფაილები სვეტოვანია, რაც მათ უფრო ეფექტურს ხდის შესანახად, ჩასატვირთად და გასაანალიზებლად. ეს განსაკუთრებით მნიშვნელოვანია დიდ მონაცემთა ნაკრებებთან მუშაობისას, რასაც სულ უფრო ხშირად ვხედავთ დიდი ენობრივი მოდელების (LLM) ეპოქაში. ამის მხარდასაჭერად, მონაცემთა ნაკრების დამთვალიერებელი ავტომატურად გარდაქმნის და აქვეყნებს ჰაბზე არსებულ ნებისმიერ საჯარო მონაცემთა ნაკრებს Parquet ფაილებად. Parquet ფაილების URL-ის მიღება შესაძლებელია /parquet ენდპოინტის მეშვეობით. DuckDB გთავაზობთ შთამბეჭდავ შესრულებას რთული ანალიტიკური მოთხოვნების გასაშვებად. მას შეუძლია SQL მოთხოვნის შესრულება უშუალოდ დისტანციურ Parquet ფაილზე ყოველგვარი დამატებითი დანახარჯის გარეშე. httpfs გაფართოების მეშვეობით, DuckDB-ს შეუძლია დისტანციური ფაილების, მაგალითად, ჰაბზე შენახული მონაცემთა ნაკრებების მოძიება /parquet ენდპოინტიდან მიღებული URL-ის გამოყენებით. DuckDB ასევე მხარს უჭერს მრავალი Parquet ფაილის მოძიებას, რაც ძალიან მოსახერხებელია, რადგან მონაცემთა ნაკრების დამთვალიერებელი დიდ მონაცემთა ნაკრებებს ყოფს 500 მბ-იან პატარა ნაწილებად. იმის ცოდნა, თუ რა არის მონაცემთა ნაკრების შიგნით, მნიშვნელოვანია მოდელების შესაქმნელად, რადგან მას შეუძლია გავლენა მოახდინოს მოდელის ხარისხზე მრავალი გზით! მომხმარებლებისთვის ნებისმიერი SQL მოთხოვნის დაწერისა და შესრულების ნებართვით ჰაბის მონაცემთა ნაკრებებზე, ეს არის კიდევ ერთი გზა ჩვენთვის, რათა უზრუნველვყოთ მონაცემთა ნაკრებებზე ღია წვდომა და დავეხმაროთ მომხმარებლებს უკეთ გაეცნონ მონაცემთა ნაკრებების შიგთავსს. მოხარულნი ვართ, რომ ამას სცდით და მოუთმენლად ველით, თუ რა სახის გამჭრიახობას გამოავლენს თქვენი ანალიზი!