fastText-ის მოდელები Hugging Face-ზე: 157 ენის ვექტორები და ენის იდენტიფიკაცია Meta AI-სთან თანამშრომლობით
Hugging Face-მა, Meta AI-სთან თანამშრომლობით, უზრუნველყო fastText-ის მოდელების, მათ შორის 157 ენის სიტყვის ვექტორებისა და ენის იდენტიფიკაციის უახლესი მოდელის, ხელმისაწვდომობა. ეს ინტეგრაცია მომხმარებლებს საშუალებას აძლევს, მარტივად ჩამოტვირთონ და გამოიყენონ ეს მასშტაბირებადი გადაწყვეტილებები ტექსტის წარმოდგენისა და კლასიფიკაციისთვის, ასევე გამოსცადონ სხვადასხვა ვიჯეტები.
Hugging Face-ის ინფრასტრუქტურის განახლება მონაცემთა გადაცემის გამოწვევების დასაძლევად
სტატია აღწერს Hugging Face-ის ინფრასტრუქტურის მასშტაბურ განახლებას, რომელიც მიზნად ისახავს მონაცემთა ატვირთვისა და ჩამოტვირთვის არსებული შეზღუდვების დაძლევას. ამჟამინდელი სისტემა, რომელიც AWS S3-სა და CloudFront-ს ეყრდნობა, ვეღარ აკმაყოფილებს მზარდი ზომის ხელოვნური ინტელექტის მოდელებისა და მონაცემთა ნაკრებების მოთხოვნებს. ახალი არქიტექტურა წარმოადგენს კონტენტზე მისამართირებულ საცავს (Content-Addressed Store - CAS), რომელიც ფაილებს ბაიტის დონეზე ამუშავებს, რაც საშუალებას იძლევა ოპტიმიზაციის, გადა
Hugging Face-ი ფაილების გადაცემის არქიტექტურას ანახლებს: ახალი მიდგომა დიდი მოცულობის მონაცემებისთვის
Hugging Face აცხადებს ინფრასტრუქტურის მნიშვნელოვან განახლებას, რათა ოპტიმიზაცია გაუკეთოს მოდელებისა და მონაცემთა ნაკრებების დიდი ზომის ფაილების ატვირთვასა და ჩამოტვირთვას. არსებული CDN-ის (AWS CloudFront) 50GB ლიმიტის გამოწვევის ფონზე, კომპანია ნერგავს კონტენტზე მიბმულ საცავს (CAS), როგორც ახალ არქიტექტურულ ელემენტს. ეს ახალი სისტემა იყენებს "სულელი წაკითხვების" და "ჭკვიანი ჩაწერების" პერსონალიზებულ პროტოკოლს, რომელიც აანალიზებს ფაილებს ბაიტის დონეზე, რათა გააუმჯობესოს გადაცემის სიჩქარე, უზრუნვე
SQL მოთხოვნების მხარდაჭერა DuckDB-ით ჰაბზე არსებული მონაცემთა ნაკრებებისთვის
ჰაბზე დაემატა ახალი ფუნქცია, რომელიც მომხმარებლებს საშუალებას აძლევს, გაუშვან SQL მოთხოვნები DuckDB-ის გამოყენებით ნებისმიერ მონაცემთა ნაკრებზე. ეს ინტეგრაცია აუმჯობესებს დიდ მონაცემთა ნაკრებებთან მუშაობის ეფექტურობას Parquet ფაილების ფორმატის და დისტანციური წვდომის შესაძლებლობების მეშვეობით, რაც ხელს უწყობს ღია წვდომას და ანალიზს, განსაკუთრებით დიდი ენობრივი მოდელების (LLM) ეპოქაში.
ევროკავშირის AI აქტი: რა უნდა იცოდნენ ღია კოდის AI სისტემების შემქმნელებმა
ევროკავშირის ხელოვნური ინტელექტის აქტი (AI Act) შესაძლოა გავრცელდეს ღია კოდის AI სისტემებსა და მოდელებზე, სპეციფიკური წესებით, რომლებიც დამოკიდებულია მოდელის ტიპსა და მის გამოშვებაზე. უმეტეს შემთხვევაში, ვალდებულებები მოიცავს მკაფიო დოკუმენტაციის მიწოდებას, მოდელის შესახებ ინფორმაციის გასამჟღავნებლად ხელსაწყოების დამატებას განთავსებისას და არსებული საავტორო უფლებებისა და კონფიდენციალურობის წესების დაცვას. საბედნიეროდ, ამ პრაქტიკის უმეტესობა უკვე გავრცელებულია ღია კოდის სივრცეში, და Hugging Face
Hugging Face Hub: მანქანური სწავლების შესაძლებლობები GLAM სექტორისთვის
Hugging Face მიზნად ისახავს უმაღლესი ხარისხის მანქანური სწავლების საყოველთაო ხელმისაწვდომობას. ამის მისაღწევად კომპანია აწვდის ღია კოდის ბიბლიოთეკებს, უფასო კურსებს და Hugging Face Hub-ს – ცენტრალურ საცავს 190,000-ზე მეტი მოდელით, 33,000 მონაცემთა ნაკრებით და 100,000-ზე მეტი აპლიკაციით. ეს სტატია განკუთვნილია GLAM სექტორში (გალერეები, ბიბლიოთეკები, არქივები, მუზეუმები) მომუშავე პირებისთვის, რათა გაიგონ, როგორ გამოიყენონ და როგორ შეიტანონ წვლილი Hub-ში. მაგალითად, NER მოდელის გამოყენება ციფრული დ
როგორ აუმჯობესებს Capital Fund Management (CFM) ფინანსური მონაცემების ანალიზს Hugging Face-ის დიდი ენობრივი მოდელების (LLM) დახმარებით
Capital Fund Management (CFM), პარიზში დაფუძნებული ალტერნატიული ინვესტიციების მართვის ფირმა, თანამშრომლობს Hugging Face-ის ექსპერტთა მხარდაჭერის გუნდთან, რათა გამოიყენოს ღია წყაროს დიდი ენობრივი მოდელები (LLMs) ფინანსური აპლიკაციებისთვის. თანამშრომლობის მთავარი მიზანია გააუმჯობესოს ფინანსური სუბიექტების ამოცნობა (მაგ., კომპანიების სახელები) საინფორმაციო სტატიებიდან, რაც კრიტიკულია ავტომატიზირებული სავაჭრო სტრატეგიებისთვის. CFM-მა გამოიკვლია LLM-ის დახმარებით დატეგვის, მცირე მოდელების 'fine-tunin
LLM-ების შეფასება: სად შეგვიძლია ვენდოთ მონაცემებს?
სტატია განიხილავს დიდი ენობრივი მოდელების (LLM) შეფასების არსებულ გამოწვევებს, განსაკუთრებით GPT-4-ზე დაფუძნებულ მეტრიკაზე დამოკიდებულებას, რაც შესაძლოა სრულად არ ასახავდეს ადამიანურ უპირატესობებს. ხაზგასმულია ადამიანურად მარკირებული მონაცემების მნიშვნელობა რეალური უპირატესობების გასაზომად და წარმოდგენილია Hugging Face Open LLM ლიდერბორდის გაფართოება. ეს გაფართოებული ლიდერბორდი აერთიანებს ავტომატიზებულ აკადემიურ ბენჩმარკებს, პროფესიონალურ ადამიანურ მარკირებას და GPT-4 შეფასებებს, რათა უზრუნველყო
AraGen-ის ლიდერბორდი: ინოვაციური ჩარჩო დიდი ენობრივი მოდელების ყოვლისმომცველი შეფასებისთვის
AraGen-ის ლიდერბორდი წარმოადგენს ახალ, ინოვაციურ ჩარჩოს დიდი ენობრივი მოდელების (დემ) შესაფასებლად. ის გვთავაზობს 3C3H საზომს, რომელიც აფასებს მოდელის პასუხებს ექვს განზომილებაში (სისწორე, სრულყოფილება, ლაკონურობა, გამოსადეგობა, პატიოსნება და უვნებლობა) დემ-მოსამართლის პრინციპზე დაყრდნობით, ფაქტობრივი სიზუსტისა და გამოყენებადობის გათვალისწინებით. სისტემა მოიცავს დინამიურ შეფასებებს ბრმა ტესტირების ციკლებით მონაცემთა დაბინძურების თავიდან ასაცილებლად. AraGen განსაკუთრებულ აქცენტს აკეთებს არაბული ე
AMD Hugging Face-ის აპარატურის პარტნიორი ხდება: ახალი ეტაპი ხელოვნური ინტელექტის განვითარებაში
ტექნოლოგიურმა გიგანტებმა Hugging Face-მა და AMD-მ გამოაცხადეს სტრატეგიული პარტნიორობა, რომელიც მიზნად ისახავს უახლესი ტრანსფორმატორული მოდელების ოპტიმიზაციას AMD-ის ცენტრალურ პროცესორებსა (CPUs) და გრაფიკულ პროცესორებზე (GPUs). ეს თანამშრომლობა მნიშვნელოვნად გააფართოებს ღრმა სწავლისთვის ხელმისაწვდომი აპარატურის არჩევანს, შეამცირებს ხარჯებს და დააწესებს ახალ სტანდარტებს ხელოვნური ინტელექტის (AI) გამოთვლებში.
ხელოვნური ინტელექტის შეცდომების გამოსწორება: ინტერაქტიული ასისტენტის ტესტირება Keras Chatbot Arena-ზე
ეს სტატია აღწერს ექსპერიმენტს, რომელიც მიზნად ისახავს შეამოწმოს, რამდენად ეფექტურად შეუძლიათ დიდ ენობრივ მოდელებს (LLM) საკუთარი შეცდომების გამოსწორება მარტივი ინგლისური უკუკავშირის საფუძველზე. ავტორი ქმნის სპეციალურ გარემოს Gradio-ზე Spaces-ით, Keras-ის, JAX-ისა და TPUs-ის გამოყენებით, რათა ერთდროულად რამდენიმე ჩეთბოტთან იმუშაოს და შეაფასოს მათი უნარი, მოახდინონ API ზარების გენერირება და შეასწორონ შეცდომები. განხილულია ტექნიკური დეტალები და მიდგომები მოდელების მრავალ ბირთვზე ოპტიმიზაციისთვის, მ
კონტენტის პოლიტიკის განახლება: ხელოვნური ინტელექტი, თანხმობა და თანამშრომლობა
ჩვენი განახლებული კონტენტის პოლიტიკა ეხება ხელოვნური ინტელექტისა და მანქანური სწავლების სირთულეებს, ხაზს უსვამს პასუხისმგებლობით განვითარებას, მომხმარებლის უფლებებსა და თანხმობის კრიტიკულ როლს. ის ხელს უწყობს საზოგადოების თანამშრომლობას და ასახავს ძალისხმევას უსაფრთხო, გამჭვირვალე პლატფორმის შესანარჩუნებლად ტექნოლოგიურ და სამართლებრივ მიღწევებთან ადაპტირებისას.
Google-მა PaliGemma 2 წარმოადგინა: ახალი მოდელები გაუმჯობესებული შესაძლებლობებით
Google-მა გამოუშვა PaliGemma 2, ვიზუალურ-ენობრივი მოდელის განახლებული ვერსია, რომელიც წარმოდგენილია 3B, 10B და 28B პარამეტრის ზომებში, სხვადასხვა შეყვანის რეზოლუციის მხარდაჭერით (224x224, 448x448, 896x896). ეს სიახლე მოდელს უფრო მოქნილს ხდის სხვადასხვა გამოყენების შემთხვევებისთვის, წინა 3B ვარიანტთან შედარებით. PaliGemma 2 აერთიანებს SigLIP გამოსახულების ენკოდერს Gemma 2 ენობრივ მოდელთან და შექმნილია მარტივი დაზუსტებისთვის, რაც მომხმარებლებს საშუალებას აძლევს, უკეთ მოარგონ ის კონკრეტულ ამოცანებს
Livebook, Elixir და Hugging Face: მანქანური სწავლების ახალი ჰორიზონტები
სტატია მიმოიხილავს ჩატის აპლიკაციას, რომელიც აუდიო შეტყობინებებს Whisper ML მოდელის გამოყენებით ტექსტად გარდაქმნის და წარმოაჩენს Livebook-ისა და Elixir-ის მანქანური სწავლების ეკოსისტემის შესაძლებლობებს. დეტალურად არის განხილული Elixir-ის საზოგადოების თანამშრომლობა Hugging Face პლატფორმასთან, მათ შორის Bumblebee ბიბლიოთეკის, tokenizers-ის და Livebook-ის Hugging Face Spaces-ში ინტეგრაციის მაგალითები, რაც მანქანური სწავლის გამოყენების ახალ გზებს ხსნის.
„მონაცემები ერთად უკეთესია“: Hugging Face და ღია კოდის AI საზოგადოება რევოლუციას ახდენენ გამოსახულების გენერაციაში
სტატია აღწერს Hugging Face-ისა და ღია კოდის AI საზოგადოების ერთობლივ პროექტს, სახელწოდებით „მონაცემები ერთად უკეთესია“, რომელიც მიზნად ისახავს ღია კოდის ეფექტური მონაცემთა ნაკრებების შექმნას. მნიშვნელოვანი მიღწევაა `open-image-preferences-v1`, უნიკალური გამოსახულების უპირატესობის მონაცემთა ნაკრები, რომელიც გამოირჩევა მრავალფეროვანი პრომპტებითა და ღია განვითარებით. მონაცემთა ნაკრები დეტალურად შეიქმნა სინთეზური მონაცემების გენერაციის, ტოქსიკურობის მოწინავე ფილტრაციისა და Flux-ისა და Stable Diffusi
Core ML-ის ოპტიმიზაცია: Apple-ის მოწყობილობებზე AI მოდელების მუშაობის ახალი დონე
Core ML-ის უახლესი გაუმჯობესებები მნიშვნელოვნად აჩქარებს ხელოვნური ინტელექტის (AI) მოდელების, მათ შორის Stable Diffusion-ისა და დიდი ენის მოდელების, მუშაობას Apple-ის მოწყობილობებზე. ეს ოპტიმიზაციები, რომელიც მოიცავს 6-ბიტიან პალეტიზაციას და ml-stable-diffusion რეპოზიტორიუმის განახლებას, უზრუნველყოფს მონაცემთა ნაკლებ გადაცემას, მეტ კონფიდენციალურობას და ხარჯების დაზოგვას, რაც დეველოპერებს აძლევს საშუალებას, შექმნან უფრო ეფექტური აპლიკაციები უშუალოდ მოწყობილობაზე.
Hugging Face-ის ღია მოდელები ახლა უკვე ხელმისაწვდომია Amazon Bedrock Marketplace-ზე
Hugging Face-ის პოპულარული ღია მოდელები ახლა უკვე ხელმისაწვდომია Amazon Bedrock-ზე, ახალი Bedrock Marketplace-ის ფარგლებში. AWS-ის მომხმარებლებს შეუძლიათ 83 ღია მოდელის განთავსება გენერაციული ხელოვნური ინტელექტის (Generative AI) აპლიკაციების შესაქმნელად. ეს ინტეგრაცია აერთიანებს SageMaker Jumpstart-ის გამოყენების სიმარტივეს Amazon Bedrock-ის სრულად მართულ ინფრასტრუქტურასთან, რაც უზრუნველყოფს მაღალი დონის API-ებთან თავსებადობას.
ტრანსფორმერები დროითი სერიების პროგნოზირებაში: Autoformer-ის ინოვაცია და ეფექტურობის დადასტურება
ამ პოსტში განხილულია Transformer მოდელების ეფექტურობა დროითი სერიების პროგნოზირებისთვის. წარმოდგენილია Informer მოდელი, რომელმაც 2021 წლის AAAI-ის საუკეთესო ნაშრომის ჯილდო მოიპოვა. მიუხედავად იმისა, რომ ზოგიერთი კვლევა, მათ შორის DLinear-ის, ეჭვქვეშ აყენებს მათ ეფექტურობას, ემპირიული მონაცემები ადასტურებს, რომ ტრანსფორმერები, განსაკუთრებით Autoformer მოდელი, საგრძნობლად აჭარბებენ მარტივ ხაზოვან მოდელებს. სტატია დეტალურად განიხილავს Autoformer-ის საკვანძო ინოვაციებს: დაშლის ფენას (Decomposition L
LeMaterial-ის გაშვება: ღია კოდის კოლაბორაციული პროექტი მასალების კვლევისთვის Entalpic-ისა და Hugging Face-ისგან
Entalpic-ისა და Hugging Face-ის მიერ ინიცირებული ღია კოდის კოლაბორაციული პროექტი LeMaterial ამოქმედდა, რომლის მიზანია მასალების კვლევის გამარტივება და დაჩქარება. პროექტი ხელს შეუწყობს მანქანური სწავლების მოდელების გაწვრთნას, ახალი მასალების იდენტიფიცირებას და ქიმიური სივრცეების შესწავლას. პირველ ეტაპზე გამოვიდა LeMat-Bulk მონაცემთა ნაკრები, რომელიც აერთიანებს, ასუფთავებს და სტანდარტიზაციას უკეთებს წამყვან მონაცემთა ბაზებს (Materials Project, Alexandria, OQMD), ქმნის 6.7 მილიონი ჩანაწერისა და 7 მ
MMS: ხელოვნური ინტელექტი მრავალენოვანი მეტყველების ამოცნობისა და გადაშენების პირას მყოფი ენების გადასარჩენად
Meta AI-ის უახლესი მოდელი, Massive Multilingual Speech (MMS), რევოლუციას ახდენს მეტყველების ავტომატური ამოცნობის (ASR) სფეროში. მას შეუძლია 1,100-ზე მეტი ენის იდენტიფიცირება, ტრანსკრიფცია და გენერირება, მათ შორის გადაშენების პირას მყოფი ენებისაც. ადაპტერის გაწვრთნის ინოვაციური მეთოდის წყალობით, MMS აღწევს სიტყვების შეცდომის საოცრად დაბალ მაჩვენებლებს მინიმალური დამატებითი გაწვრთნით, რაც განსაკუთრებით ეფექტურია დაბალი რესურსების მქონე ენებისთვის. ეს ტექნოლოგია პოტენციურად გადამწყვეტ როლს ითამაშებ
Meta AI-ის რევოლუციური MMS მოდელი: 1100-ზე მეტი ენის მხარდაჭერა და გადაშენების პირას მყოფი ენების შენარჩუნება
Meta AI-მ წარმოადგინა Massive Multilingual Speech (MMS) მოდელი, რომელსაც შეუძლია 1100-ზე მეტი ენის ამოცნობა, ტრანსკრიფცია და გენერაცია. ეს ინოვაციური სისტემა, რომელიც იყენებს „ადაპტერის“ წვრთნის მეთოდს, მნიშვნელოვნად ამცირებს შეცდომის მაჩვენებელს მცირე რესურსების მქონე ენებისთვის და ხელს უწყობს გადაშენების პირას მყოფი ენების შენარჩუნებას, რადგან მათთვის წერილობითი ჩანაწერების შექმნასა და მშობლიურ ენაზე კომუნიკაციას უწყობს ხელს. MMS-ის ადაპტერის წვრთნა უფრო ეფექტურია მეხსიერების თვალსაზრისით, უფრ
სინთეზური მონაცემების გენერაცია: ხელოვნური ინტელექტის შესაძლებლობების გაფართოება
სტატია მიმოიხილავს სინთეზური მონაცემების მნიშვნელობასა და გენერაციის პროცესს. სინთეზური მონაცემები არის ხელოვნურად შექმნილი ინფორმაცია, რომელიც რეალურ სამყაროს მონაცემებს მიბაძავს და ხელს უწყობს მონაცემთა შეზღუდვების დაძლევას, ნაკრებების გაფართოებით ან გაუმჯობესებით. აღწერილია სინთეზური მონაცემების გენერატორის გამოყენება Hugging Face-ის უფასო API-სა და Argilla-ს ინტეგრაციის მეშვეობით, ტექსტის კლასიფიკაციისა და ჩატის მონაცემთა ნაკრებების შესაქმნელად. მოცემულია დეტალური სამსაფეხურიანი პროცესი მონა
Hugging Face-ი აშშ-ის ვაჭრობის დეპარტამენტს ხელოვნური ინტელექტის ანგარიშვალდებულების შესახებ რეკომენდაციებს წარუდგენს
12 ივნისს, Hugging Face-მა აშშ-ის ვაჭრობის დეპარტამენტს (NTIA) ხელოვნური ინტელექტის ანგარიშვალდებულების პოლიტიკის შესახებ თავისი პასუხი წარუდგინა. კომპანია ხაზს უსვამს დოკუმენტაციისა და გამჭვირვალობის მნიშვნელობას, ასევე დაინტერესებული მხარეების სრულ ექსპერტიზაზე დაყრდნობის აუცილებლობას. Hugging Face-ის მისიაა „კარგი მანქანური სწავლების დემოკრატიზაცია“, რაც გულისხმობს სისტემების მარტივ გაგებას, შეფასებას და კრიტიკას ყველა დაინტერესებული მხარისთვის.
აგენტური AI-ის პოტენციალის განბლოკვა CPU-ზე: Intel Xeon და AMX-ის როლი
აგენტური ხელოვნური ინტელექტი (AI) AI-ის განვითარების შემდეგ ეტაპად მიიჩნევა, რომელიც LLM-ების მსჯელობის შესაძლებლობებს კონტექსტის ღრმა გაგებასთან აკავშირებს. თუმცა, არსებობს გამოწვევა 'მასპინძელი-აქსელერატორი' ტრაფიკის ზედმეტი დატვირთვის მხრივ, რადგან სისტემებში სულ უფრო მეტი CPU-ზე მომუშავე ხელსაწყო ინტეგრირდება. ამ პრობლემის გადასაჭრელად, მუშავდება მცირე ენობრივი მოდელები (SLM) და CPU-ები, როგორიცაა Intel Xeon-ის მე-4 და მე-5 თაობა, რომლებიც ინტეგრირებულ AMX ტექნოლოგიას გვთავაზობენ AI მუშაობის