Sentence Transformers (ასევე ცნობილი როგორც SentenceBERT ან SBERT) არის პოპულარული ღია კოდის ბიბლიოთეკა მაღალი ხარისხის ემბედინგების გენერირებისთვის, რომლებიც სემანტიკურ მნიშვნელობას აღბეჭდავს. ნილს რაიმერსის მიერ მისი დაარსების დღიდან 2019 წელს, Sentence Transformers ფართოდ იქნა მიღებული მკვლევრებისა და პრაქტიკოსების მიერ ბუნებრივი ენის დამუშავების (NLP) სხვადასხვა ამოცანებისთვის, მათ შორის სემანტიკური ძიებისთვის, სემანტიკური ტექსტური მსგავსებისთვის, კლასტერიზაციისა და პარაფრაზების მოპოვებისთვის. საზოგადოების მიერ და საზოგადოებისთვის წლების განმავლობაში განვითარებისა და ვარჯიშის შემდეგ, 16,000-ზე მეტი Sentence Transformers მოდელი საჯაროდ ხელმისაწვდომია Hugging Face Hub-ზე, რომელიც ყოველთვიურად მილიონზე მეტ უნიკალურ მომხმარებელს ემსახურება. "Sentence Transformers დიდი წარმატების ისტორიაა და ჩვენი ლაბორატორიისთვის სემანტიკური მსგავსებების გამოთვლის ხანგრძლივი კვლევის კულმინაციაა. ნილს რაიმერსმა ძალიან დროული აღმოჩენა გააკეთა და არა მხოლოდ გამორჩეული კვლევის შედეგები, არამედ უაღრესად გამოსადეგი ინსტრუმენტიც შექმნა. ეს აგრძელებს ზეგავლენას ბუნებრივი ენის დამუშავებისა და ხელოვნური ინტელექტის სფეროში მომავალი თაობის სტუდენტებსა და პრაქტიკოსებზე. ასევე მინდა მადლობა გადავუხადო ყველა მომხმარებელს და განსაკუთრებით კონტრიბუტორებს, რომელთა გარეშეც ეს პროექტი დღესდღეობით ასეთი ვერ იქნებოდა. და ბოლოს, მინდა მადლობა გადავუხადო ტომს და Hugging Face-ს პროექტის მომავალში გადატანისთვის." "აღფრთოვანებულები ვართ, რომ ოფიციალურად მივესალმებით Sentence Transformers-ს Hugging Face-ის ოჯახში! ბოლო ორი წლის განმავლობაში, გასაოცარი იყო იმის დანახვა, თუ როგორ გადაიზარდა ეს პროექტი მასობრივ გლობალურ გამოყენებაში, UKP Lab-ის წარმოუდგენელი ფუძემდებლური მუშაობისა და მის გარშემო არსებული საოცარი საზოგადოების წყალობით. ეს მხოლოდ დასაწყისია: ჩვენ გავაგრძელებთ მისი ზრდისა და ინოვაციების მხარდაჭერას, ამავდროულად შევინარჩუნებთ ღია, კოლაბორაციულ სულისკვეთებას, რამაც მას თავიდანვე წარმატება მოუტანა." Sentence Transformers დარჩება საზოგადოებაზე ორიენტირებული, ღია კოდის პროექტი, იმავე ღია კოდის ლიცენზიით (Apache 2.0), რაც ადრე ჰქონდა. მკვლევრების, დეველოპერებისა და ენთუზიასტების კონტრიბუციები მისასალმებელი და წახალისებულია. პროექტი გააგრძელებს გამჭვირვალობის, თანამშრომლობისა და ფართო ხელმისაწვდომობის პრიორიტეტულობას. Sentence Transformers-ის ბიბლიოთეკა 2019 წელს წარადგინა დოქტორმა ნილს რაიმერსმა დარმშტადტის ტექნიკური უნივერსიტეტის Ubiquitous Knowledge Processing (UKP) ლაბორატორიაში, პროფესორ დოქტორ ირინა გურევიჩის ზედამხედველობით. სტანდარტული BERT ემბედინგების შეზღუდვებით წინადადების დონის სემანტიკური ამოცანებისთვის მოტივირებულმა, Sentence-BERT-მა გამოიყენა სიამის ქსელის არქიტექტურა სემანტიკურად მნიშვნელოვანი წინადადების ემბედინგების შესაქმნელად, რომლებიც ეფექტურად შედარებადი იყო კოსინუსური მსგავსების გამოყენებით. მისი მოდულური, ღია კოდის დიზაინისა და ძლიერი ემპირიული შესრულების წყალობით ისეთ ამოცანებზე, როგორიცაა სემანტიკური ტექსტური მსგავსება, კლასტერიზაცია და ინფორმაციის მოძიება, ბიბლიოთეკა სწრაფად გახდა NLP კვლევის ინსტრუმენტარიუმის განუყოფელი ნაწილი, რამაც საფუძველი ჩაუყარა შემდგომი მუშაობისა და რეალური სამყაროს აპლიკაციების მთელ რიგს, რომლებიც ეყრდნობა მაღალი ხარისხის წინადადების წარმოდგენებს. 2020 წელს ბიბლიოთეკას დაემატა მრავალენოვანი მხარდაჭერა, რამაც წინადადების ემბედინგები 400-ზე მეტ ენაზე გააფართოვა. 2021 წელს, ნანდან თაკურისა და დოქტორ იოჰანეს დაქსენბერგერის კონტრიბუციებით, ბიბლიოთეკა გაფართოვდა და მხარი დაუჭირა წყვილ-წყვილად წინადადების შეფასებას Cross Encoder-ისა და Sentence Transformer-ის მოდელების გამოყენებით. Sentence Transformers ასევე ინტეგრირებული იქნა Hugging Face Hub-თან (v2.0). ოთხ წელზე მეტი ხნის განმავლობაში, UKP Lab-ის გუნდი ბიბლიოთეკას ინარჩუნებდა, როგორც საზოგადოებაზე ორიენტირებულ ღია კოდის პროექტს და უზრუნველყოფდა უწყვეტ კვლევაზე დაფუძნებულ ინოვაციებს. ამ პერიოდში, პროექტის განვითარება მხარდაჭერილი იყო პროფესორ გურევიჩისთვის გერმანიის კვლევების ფონდის (DFG), გერმანიის განათლებისა და კვლევების ფედერალური სამინისტროს (BMBF) და ჰესენის უმაღლესი განათლების, კვლევებისა და ხელოვნების სახელმწიფო სამინისტროს (HMWK) გრანტებით. 2023 წლის ბოლოს, ტომ აარსენმა Hugging Face-დან აიღო ბიბლიოთეკის მოვლა-პატრონობა, დანერგა Sentence Transformer მოდელების მოდერნიზებული ტრენინგი (v3.0), ასევე გააუმჯობესა Cross Encoder (v4.0) და Sparse Encoder (v5.0) მოდელები. დარმშტადტის ტექნიკური უნივერსიტეტის Ubiquitous Knowledge Processing (UKP) ლაბორატორია, რომელსაც პროფესორი დოქტორი ირინა გურევიჩი ხელმძღვანელობს, საერთაშორისოდ არის აღიარებული თავისი კვლევებისთვის ბუნებრივი ენის დამუშავებასა (NLP) და მანქანურ სწავლებაში. ლაბორატორიას აქვს პიონერული მუშაობის ხანგრძლივი ისტორია წარმოდგენის სწავლებაში, დიდ ენობრივ მოდელებში და ინფორმაციის მოძიებაში, მრავალი პუბლიკაციით წამყვან კონფერენციებსა და ჟურნალებში. Sentence Transformers-ის გარდა, UKP Lab-მა შეიმუშავა არაერთი ფართოდ გამოყენებული მონაცემთა ნაკრები, ბენჩმარკები და ღია კოდის ინსტრუმენტები, რომლებიც მხარს უჭერს როგორც აკადემიურ კვლევებს, ასევე რეალური სამყაროს აპლიკაციებს. Hugging Face მადლობას უხდის UKP Lab-ს და ყველა წარსულ და ამჟამინდელ კონტრიბუტორს, განსაკუთრებით დოქტორ ნილს რაიმერსს და პროფესორ დოქტორ ირინა გურევიჩს, პროექტისადმი მათი ერთგულებისთვის და მისი მოვლა-პატრონობის, ახლა კი მისი მართვის ჩვენთვის მინდობისთვის. ჩვენ ასევე მადლობას ვუხდით მკვლევრების, დეველოპერებისა და პრაქტიკოსების საზოგადოებას, რომლებმაც წვლილი შეიტანეს ბიბლიოთეკის წარმატებაში მოდელების კონტრიბუციების, შეცდომების მოხსენებების, ფუნქციების მოთხოვნების, დოკუმენტაციის გაუმჯობესებისა და რეალური სამყაროს აპლიკაციების მეშვეობით. ჩვენ მოხარულნი ვართ, რომ ერთობლივად...