AI-ის რევოლუცია მონაცემებთან ურთიერთობაში: DuckDB-NSQL-7B და ტექსტიდან SQL-ზე გადასვლა
ხელოვნური ინტელექტის (AI) და დიდი ენობრივი მოდელების (LLM) განვითარება რევოლუციას ახდენს მონაცემთა ანალიზში. ტრადიციულად, SQL ქუერების შექმნა მოითხოვდა სპეციალიზებულ ცოდნას, რაც ხელმისაწვდომობის ხარვეზს ქმნიდა. MotherDuck-მა და Numbers Station-მა წარმოადგინეს DuckDB-NSQL-7B, LLM, რომელიც სპეციალურად DuckDB SQL-ისთვისაა შექმნილი. ეს მოდელი მომხმარებლებს საშუალებას აძლევს, ბუნებრივი ენით ჩამოაყალიბონ მონაცემთა მოთხოვნები, რომლებსაც მოდელი ავტომატურად თარგმნის SQL ბრძანებებში. სტატიაში დეტალურად არ
დეველოპერები სულ უფრო მეტად აცნობიერებენ ამ აპლიკაციების პოტენციურ სარგებელს, განსაკუთრებით ძირითადი ამოცანების გაუმჯობესებაში, როგორიცაა სკრიპტების წერა, ვებ დეველოპმენტი და, ახლა უკვე, მონაცემებთან ურთიერთობა. ისტორიულად, მონაცემთა ანალიზისთვის გამჭრიახი SQL მოთხოვნების შექმნა, ძირითადად, მონაცემთა ანალიტიკოსების, SQL დეველოპერების, მონაცემთა ინჟინრების ან მასთან დაკავშირებული სფეროების პროფესიონალების პრეროგატივა იყო, რომლებიც ყველა SQL დიალექტის სინტაქსის ნიუანსებში ერკვეოდნენ. თუმცა, ხელოვნური ინტელექტის (AI) საშუალებით მომუშავე გადაწყვეტილებების გაჩენასთან ერთად, სიტუაცია იცვლება. ეს მოწინავე მოდელები მონაცემებთან ურთიერთობის ახალ გზებს გვთავაზობენ, რაც პოტენციურად გაამარტივებს პროცესებს და უფრო მეტი ეფექტურობითა და სიღრმით გამოავლენს გამჭრიახ ინფორმაციას. რა მოხდება, თუკი შეძლებთ თქვენი მონაცემთა ნაკრებიდან საინტერესო ინფორმაციის მოპოვებას კოდირებაში ღრმად ჩართვის გარეშე? ღირებული ინფორმაციის მოსაპოვებლად საჭიროა სპეციალიზებული SELECT ოპერატორის შექმნა, რომელშიც გათვალისწინებული იქნება, რომელი სვეტები უნდა გამოჩნდეს, წყაროს ცხრილი, შერჩეული რიგების ფილტრაციის პირობები, აგრეგაციის მეთოდები და დახარისხების პრეფერენციები. ეს ტრადიციული მიდგომა მოიცავს ბრძანებების თანმიმდევრობას: SELECT, FROM, WHERE, GROUP და ORDER. მაგრამ რა მოხდება, თუკი არ ხართ გამოცდილი დეველოპერი და მაინც გსურთ თქვენი მონაცემების პოტენციალის გამოყენება? ასეთ შემთხვევებში, SQL სპეციალისტების დახმარების მოძიება აუცილებელი ხდება, რაც ხაზს უსვამს ხელმისაწვდომობისა და გამოყენებადობის ხარვეზს. სწორედ აქ შემოდის ხელოვნური ინტელექტისა (AI) და დიდი ენობრივი მოდელების (LLM) ტექნოლოგიაში მიღწეული ინოვაციური მიღწევები ამ ხარვეზის შესავსებად. წარმოიდგინეთ, რომ შეგიძლიათ თქვენს მონაცემებთან უპრობლემოდ ისაუბროთ, უბრალოდ ჩვეულებრივი ენით ჩამოაყალიბოთ თქვენი ინფორმაციის საჭიროებები და მოდელი თქვენს მოთხოვნას ქუერის სახით გადააქცევს. ბოლო თვეებში, ამ სფეროში მნიშვნელოვანი წინსვლა შეინიშნება. MotherDuck-მა და Numbers Station-მა წარმოადგინეს თავიანთი უახლესი ინოვაცია: DuckDB-NSQL-7B, უახლესი LLM, რომელიც სპეციალურად DuckDB SQL-ისთვისაა შექმნილი. რა არის ამ მოდელის მისია? მომხმარებლებისთვის იმის შესაძლებლობის მიცემა, რომ მათ მონაცემებიდან გამჭრიახი ინფორმაცია უპრობლემოდ მოიპოვონ. თავდაპირველად Meta-ს ორიგინალური Llama-2–7b მოდელიდან იყო დაფაინთუნებული, ზოგადი SQL ქუერების ფართო მონაცემთა ნაკრების გამოყენებით, DuckDB-NSQL-7B-მ შემდგომი დახვეწა განიცადა DuckDB text-to-SQL წყვილების მეშვეობით. აღსანიშნავია, რომ მისი შესაძლებლობები სცდება SELECT ოპერატორების შექმნას; მას შეუძლია DuckDB SQL-ის მოქმედი ოპერატორების ფართო სპექტრის გენერირება, ოფიციალური დოკუმენტაციისა და გაფართოებების ჩათვლით, რაც მას მონაცემთა კვლევისა და ანალიზისთვის მრავალმხრივ ინსტრუმენტად აქცევს. ამ სტატიაში ჩვენ შევისწავლით, თუ როგორ უნდა ვიმუშაოთ text2sql ამოცანებთან DuckDB-NSQL-7B მოდელის, Hugging Face-ის მონაცემთა ნაკრების დამთვალიერებელი API-ის გამოყენებით (parquet ფაილებისთვის) და duckdb-ს მონაცემთა მოსაპოვებლად.
text2sql პროცესი
llama.cpp-ის მთავარი მიზანია LLM დასკვნის (inference) ჩართვა მინიმალური კონფიგურაციით და უახლესი წარმადობით მრავალფეროვან აპარატურაზე — როგორც ლოკალურად, ასევე ღრუბელში. ჩვენ გამოვიყენებთ ამ მიდგომას. მონაცემები გადამწყვეტი კომპონენტია მანქანური სწავლის ნებისმიერ საქმიანობაში. Hugging Face არის ღირებული რესურსი, რომელიც გთავაზობთ წვდომას 120,000-ზე მეტ თავისუფალ და ღია მონაცემთა ნაკრებზე, რომლებიც მოიცავს სხვადასხვა ფორმატს, მათ შორის CSV, Parquet, JSON, აუდიო და გამოსახულების ფაილებს. Hugging Face-ის მიერ ჰოსტირებული თითოეული მონაცემთა ნაკრები აღჭურვილია სრულყოფილი დამთვალიერებელით. ეს დამთვალიერებელი მომხმარებლებს აძლევს აუცილებელ ფუნქციებს, როგორიცაა სტატისტიკური ინფორმაცია, მონაცემთა ზომის შეფასება, სრული ტექსტის ძიების შესაძლებლობები და ეფექტური ფილტრაციის ოფციები. ეს მდიდარი ინტერფეისი მომხმარებლებს საშუალებას აძლევს, მარტივად შეისწავლონ და შეაფასონ მონაცემთა ნაკრებები, რაც ხელს უწყობს ინფორმირებული გადაწყვეტილების მიღებას მანქანური სწავლის მთელ სამუშაო პროცესში. ამ დემოსთვის, ჩვენ გამოვიყენებთ world-cities-geo მონაცემთა ნაკრებს.
world-cities-geo მონაცემთა ნაკრების დამთვალიერებელი
კულისებში, Hub-ში არსებული თითოეული მონაცემთა ნაკრები მუშავდება Hugging Face-ის მონაცემთა ნაკრების დამთვალიერებელი API-ის მიერ, რომელიც იღებს სასარგებლო ინფორმაციას და ემსახურება ისეთ ფუნქციებს, როგორიცაა: ამ დემოში, ჩვენ გამოვიყენებთ ბოლო ფუნქციას, ავტომატურად კონვერტირებულ parquet ფაილებს. პირველ რიგში, ჩამოტვირთეთ DuckDB-NSQL-7B-v0.1-ის კვანტიზებული მოდელების ვერსია.
მოდელის ჩამოტვირთვა
ალტერნატიულად, შეგიძლიათ შეასრულოთ შემდეგი კოდი: ახლა, დავაინსტალიროთ საჭირო დამოკიდებულებები: text-to-SQL მოდელისთვის, ჩვენ გამოვიყენებთ პრომპტს შემდეგი სტრუქტურით: ამრიგად, ჩვენ უნდა მივაწოდოთ მოდელს Hugging Face მონაცემთა ნაკრების სქემის შესახებ ინფორმაცია. ამისთვის, ჩვენ მივიღებთ პირველ parquet ფაილს jamescalam/world-cities-geo მონაცემთა ნაკრებისთვის: parquet ფაილი ჰოსტირებულია Hugging Face-ის დამთვალიერებელში refs/convert/parquet რევიზიის ქვეშ:
Parquet ფაილი
CREATE schema DDL არის: და, როგორც ხედავთ, ის ემთხვევა მონაცემთა ნაკრების დამთვალიერებელში არსებულ სვეტებს:
მონაცემთა ნაკრების სვეტები
თუ მომხმარებელს სურს ალბანეთის ქალაქების გაგება, პრომპტი ასე გამოიყურება: ასე რომ, გაფართოებული პრომპტი, რომელიც გაეგზავნება LLM-ს, ასე გამოიყურება: გამომავალი SQL ბრძანება მიუთითებს მონაცემთა ცხრილზე, მაგრამ რადგან ჩვენ არ გვაქვს რეალური ცხრილი, არამედ მხოლოდ მითითება parquet ფაილზე, ჩვენ შევცვლით ყველა "data" გამოჩენას first_parquet_url-ით: და საბოლოო გამომავალი იქნება: და აქ არის შედეგები (100 რიგი):
შესრულების შედეგი (100 რიგი)
შე Suizaდაროთ ეს შედეგი მონაცემთა ნაკრების დამთვალიერებელს „ძიების ფუნქციის“ გამოყენებით ალბანეთისთვის, ის იგივე უნდა იყოს:
ძიების შედეგი ალბანეთის ქვეყნისთვის
ასევე შეგიძლიათ მიიღოთ იგივე შედეგი
თეგები:
#ხელოვნური ინტელექტი
#llm
#მონაცემთა ანალიზი
#hugging face
#sql
#duckdb
#ტექსტიდან sql-ზე
#duckdb-nsql-7b
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი