მეჩხერი ჩაშენების მოდელების დახვეწა: ჰიბრიდული ძიება და სემანტიკური გაფართოება
ეს სტატია განმარტავს, თუ როგორ უნდა დავხვეწოთ მეჩხერი ენკოდერის/ჩაშენების მოდელები, რომლებიც განსაკუთრებით ეფექტურია ჰიბრიდული ძიებისა და მოძიებისა და ხელახალი რანჟირების სცენარებში. დეტალურად განიხილება მოდელის კომპონენტები, მონაცემთა ნაკრებები, დანაკარგის ფუნქციები, ტრენინგის არგუმენტები და შემფასებლები. ასევე მოცემულია შედარება მკვრივ ჩაშენებებთან და განხილულია მოთხოვნის/დოკუმენტის გაფართოების მნიშვნელობა, რაც ამ მოდელებს საშუალებას აძლევს, გაუმკლავდნენ სემანტიკურ შეუსაბამობებს და გააუმჯობესო
ამ ბლოგპოსტში გაჩვენებთ, როგორ გამოიყენოთ ის მეჩხერი ენკოდერის/ჩაშენების მოდელის დასახვეწად და აგიხსნით, რატომ შეიძლება დაგჭირდეთ ამის გაკეთება. ეს ქმნის sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq-ს, იაფ მოდელს, რომელიც განსაკუთრებით კარგად მუშაობს ჰიბრიდულ ძიებაში ან მოძიებისა და ხელახალი რანჟირების სცენარებში. მეჩხერი ჩაშენების მოდელების დახვეწა რამდენიმე კომპონენტს მოიცავს: მოდელს, მონაცემთა ნაკრებებს, დანაკარგის ფუნქციებს, ტრენინგის არგუმენტებს, შემფასებლებს და ტრენერის კლასს. განვიხილავ თითოეულ ამ კომპონენტს, რომელსაც თან ახლავს პრაქტიკული მაგალითები, თუ როგორ შეიძლება მათი გამოყენება ძლიერი მეჩხერი ჩაშენების მოდელების დასახვეწად. საკუთარი მოდელების მომზადების გარდა, შეგიძლიათ აირჩიოთ Hugging Face Hub-ზე ხელმისაწვდომი წინასწარ მომზადებული მეჩხერი ენკოდერების ფართო სპექტრიდან. ამ მზარდ სივრცეში ნავიგაციის გასაადვილებლად, ჩვენ შევქმენით SPLADE მოდელების კოლექცია, რომელიც ხაზს უსვამს ყველაზე აქტუალურ მოდელებს. დოკუმენტაციაში, "წინასწარ მომზადებული მოდელების" განყოფილებაში ჩამოთვლილია ყველაზე გამორჩეული მოდელები მათი ბენჩმარკის შედეგებთან ერთად. ზოგადი ტერმინი „ჩაშენების მოდელები“ გულისხმობს მოდელებს, რომლებიც გარდაქმნიან რაიმე შეტანილ ინფორმაციას, ჩვეულებრივ ტექსტს, ვექტორულ წარმოდგენად (ჩაშენებად), რომელიც აღბეჭდავს შეტანილი ინფორმაციის სემანტიკურ მნიშვნელობას. ნედლი შეტანილი ინფორმაციისგან განსხვავებით, ამ ჩაშენებებზე შეგიძლიათ შეასრულოთ მათემატიკური ოპერაციები, რაც იწვევს მსგავსების ქულებს, რომლებიც შეიძლება გამოყენებულ იქნას სხვადასხვა ამოცანებისთვის, როგორიცაა ძიება, კლასტერირება ან კლასიფიკაცია. მკვრივი ჩაშენების მოდელების შემთხვევაში, ანუ გავრცელებული ვარიანტისთვის, ჩაშენებები, როგორც წესი, დაბალგანზომილებიანი ვექტორებია (მაგ., 384, 768 ან 1024 განზომილება), სადაც უმეტესი მნიშვნელობები არა-ნულოვანია. მეორეს მხრივ, მეჩხერი ჩაშენების მოდელები წარმოქმნიან მაღალგანზომილებიან ვექტორებს (მაგ., 30,000+ განზომილება), სადაც უმეტესი მნიშვნელობები ნულოვანია. როგორც წესი, მეჩხერ ჩაშენებაში თითოეული აქტიური განზომილება (ანუ არა-ნულოვანი მნიშვნელობის მქონე განზომილება) შეესაბამება მოდელის ლექსიკონში არსებულ კონკრეტულ ტოკენს, რაც უზრუნველყოფს ინტერპრეტირებადობას. განვიხილოთ naver/splade-v3, ხელოვნური ინტელექტის უახლესი მეჩხერი ჩაშენების მოდელი, მაგალითად: ამ მაგალითში, ჩაშენებები არის 30,522-განზომილებიანი ვექტორები, სადაც თითოეული განზომილება შეესაბამება მოდელის ლექსიკონში არსებულ ტოკენს. `decode` მეთოდმა დააბრუნა 10 ტოკენი, რომლებსაც ჩაშენებაში ყველაზე მაღალი მნიშვნელობები ჰქონდათ, რაც გვეხმარება იმის ინტერპრეტაციაში, თუ რომელი ტოკენები უდიდეს წვლილს შეიტანენ ჩაშენებაში. ჩვენ შეგვიძლია განვსაზღვროთ ჩაშენებებს შორის გადაკვეთა ან დამთხვევა, რაც ძალიან სასარგებლოა იმის დასადგენად, თუ რატომ ითვლება ორი ტექსტი მსგავსად ან განსხვავებულად: ნეირონული მეჩხერი ჩაშენების მოდელების მთავარი კომპონენტია მოთხოვნის/დოკუმენტის გაფართოება. ტრადიციული ლექსიკური მეთოდებისგან, როგორიცაა BM25, რომლებიც მხოლოდ ზუსტ ტოკენებს ემთხვევა, ნეირონული მეჩხერი მოდელები, როგორც წესი, ავტომატურად აფართოებენ ორიგინალურ ტექსტს სემანტიკურად დაკავშირებული ტერმინებით: მაგალითად, ზემოთ მოცემულ კოდის გამომავალში, წინადადება „The weather is lovely today“ გაფართოვებულია ისეთი ტერმინების ჩათვლით, როგორიცაა „beautiful“, „cool“, „pretty“ და „nice“, რომლებიც ორიგინალურ ტექსტში არ იყო. ანალოგიურად, „It's so sunny outside!“ გაფართოვებულია „weather“, „summer“ და „sun“-ის ჩათვლით. ეს გაფართოება საშუალებას აძლევს ნეირონულ მეჩხერ მოდელებს შეუსაბამონ სემანტიკურად დაკავშირებულ კონტენტს ან სინონიმებს ტოკენების ზუსტი დამთხვევის გარეშეც კი, გაუმკლავდნენ მართლწერის შეცდომებს და გადალახონ ლექსიკონის შეუსაბამობის პრობლემები. სწორედ ამიტომ, ნეირონული მეჩხერი მოდელები, როგორიცაა SPLADE, ხშირად აჭარბებენ ტრადიციულ ლექსიკურ ძიების მეთოდებს, ინარჩუნებენ მეჩხერი წარმოდგენების ეფექტურობის უპირატესობებს. თუმცა, გაფართოებას თავისი რისკები აქვს. მაგალითად, მოთხოვნის გაფართოება „What is the weather on Tuesday?“ სავარაუდოდ გაფართოვდება „monday“, „wednesday“ და ა.შ., რაც შეიძლება არ იყოს სასურველი. მოკლედ, ნეირონული მეჩხერი ჩაშენების მოდელები ღირებულ ნიშას იკავებენ ტრადიციულ ლექსიკურ მეთოდებს, როგორიცაა BM25, და მკვრივ ჩაშენების მოდელებს, როგორიცაა Sentence Transformers, შორის. მათ აქვთ შემდეგი უპირატესობები: მთელი ამ ბლოგპოსტის განმავლობაში, „მეჩხერი ჩაშენების მოდელს“ და „მეჩხერი ენკოდერის მოდელს“ ურთიერთშენაცვლებით გამოვიყენებ. (ნეირონული) მეჩხერი ჩაშენების მოდელების უმეტესობა იყენებს ზემოხსენებულ მოთხოვნის/დოკუმენტის გაფართოებას, რათა შეძლოთ ტექსტების შეხამება თითქმის იდენტური მნიშვნელობით, მაშინაც კი, თუ ისინი არ იზიარებენ არცერთ სიტყვას. მოკლედ, მოდელმა უნდა ამოიცნოს სინონიმები, რათა ეს ტოკენები საბოლოო ჩაშენებაში მოთავსდეს. მზა მეჩხერი ჩაშენების მოდელების უმეტესობა ადვილად ამოიცნობს, რომ „supermarket“, „food“ და „market“ სასარგებლო გაფართოებებია ტექსტისთვის, რომელიც შეიცავს „grocery“-ს. თუმცა, მაგალითად, სიტყვა „cephalalgia“ შეიძლება გაფართოვდეს სხვადასხვა ტერმინებით, მაშინ როდესაც ჩვენ გვინდა, რომ ის გაფართოვდეს როგორც „თავის ტკივილი“, რაც მისი გავრცელებული შესატყვისია. ეს მაგალითი ბევრ დომენზე ვრცელდება, მაგ., არ ცნობს, რომ „Java“ არის პროგრამირების ენა, რომ „Audi“ აწარმოებს მანქანებს, ან რომ „NVIDIA“ არის კომპანია, რომელიც აწარმოებს გრაფიკულ ბარათებს. დახვეწის გზით, მოდელს შეუძლია ისწავლოს ექსკლუზიურად ფოკუსირება იმ დომენზე და/ან ენაზე, რომელიც თქვენთვის მნიშვნელოვანია. Sentence Transformer მოდელების მომზადება შემდეგ კომპონენტებს მოიცავს: ახლა, მოდით უფრო დეტალურად განვიხილოთ თითოეული ეს კომპონენტი. მეჩხერი ენკოდერის მოდელები შედგება მოდულების, მეჩხერი ენკოდერისთვის სპეციფიკური მოდულების ან მორგებული მოდულების თანმიმდევრობისგან, რაც დიდ მოქნილობას იძლევა. თუ გსურთ მეჩხერი ენკოდერის მოდელის შემდგომი დახვეწა (მაგალითად, ის
თეგები:
#ai
#მანქანური სწავლება
#hugging face
#nlp
#მოდელების დახვეწა
#მეჩხერი ჩაშენება
#ჰიბრიდული ძიება
#splade
#ვექტორული წარმოდგენა
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი