Hugging Face Datasets: ახალი შესაძლებლობები აუდიო და გამოსახულების მონაცემებთან მუშაობისთვის
Hugging Face Datasets ბიბლიოთეკა აფართოებს თავის მხარდაჭერას ტექსტური მონაცემთა ნაკრებების მიღმა, რათა მოიცვას აუდიო და გამოსახულების ფორმატები. განახლებები მოიცავს ახალ ინსტრუმენტებს, როგორიცაა ImageFolder გამოსახულების მონაცემთა ნაკრებების მარტივად ჩატვირთვისა და მართვისთვის, to_tf_dataset ფუნქცია TensorFlow-თან ინტეგრაციის გასამარტივებლად და გაუმჯობესებულ დოკუმენტაციას სხვადასხვა მონაცემთა მოდალობასთან მუშაობისთვის. ეს ცვლილებები მიზნად ისახავს დეველოპერებისთვის მოდელების გაწვრთნისა და აპლიკა
Idefics2: Hugging Face-ის ახალი, 10-ჯერ მცირე ზომის მულტიმოდალური AI მოდელი მნიშვნელოვანი გაუმჯობესებებით
Idefics2, Hugging Face-ის ახალი მულტიმოდალური AI მოდელი, მისი წინამორბედისგან განსხვავებით 10-ჯერ მცირე ზომისაა და მნიშვნელოვნად გაუმჯობესებულ შესაძლებლობებს გვთავაზობს. ის გაწვრთნილია მრავალფეროვან მონაცემთა ნაკრებებზე, მათ შორის ახლად გამოშვებულ „The Cauldron“-ზე, რომელიც მრავალმხრივი საუბრებისთვისაა განკუთვნილი. მოდელი, რომელიც აგებულია Mistral-7B-v0.1-სა და siglip-so400m-patch14-384-ზე, უკვე ხელმისაწვდომია Hugging Face Hub-ზე Apache-2.0 ლიცენზიით.
JAT: ხელოვნური ინტელექტის ახალი ეტაპი – უნივერსალური აგენტი
პროექტი „ჯეკი ყველა ხელობაში“ (JAT) მიზნად ისახავს გენერალისტი AI აგენტის შექმნას, Gato-ს ნამუშევრის რეპროდუცირებითა და გაუმჯობესებით. JAT იყენებს მულტიმოდალურ ტრანსფორმერულ მოდელებს თანმიმდევრული მონაცემების დასამუშავებლად. პროექტის შედეგად შეიქმნა ექსპერტული აგენტების მონაცემთა ნაკრები და თავად JAT მოდელი, რომელმაც სხვადასხვა ამოცანაზე ექსპერტული შესრულების 65.8% საშუალო შედეგი აჩვენა, რაც მის მრავალმხრივობას ადასტურებს.
JAT: ხელოვნური ინტელექტის ახალი მიღწევა ზოგადი დანიშნულების აგენტების შექმნაში
პროექტი Jack of All Trades (JAT) წარმოადგენს მნიშვნელოვან ნაბიჯს ზოგადი დანიშნულების ხელოვნური ინტელექტის აგენტების შემუშავებაში. Gato-ს ნაშრომზე დაფუძნებული JAT იყენებს მულტიმოდალურ ტრანსფორმერულ მოდელებს, რომლებსაც შეუძლიათ შეასრულონ ხედვის, ენისა და გადაწყვეტილების მიღების ამოცანები. პროექტის ფარგლებში შეიქმნა JAT მონაცემთა ნაკრები, რომელიც მოიცავს ექსპერტი აგენტების მიერ შეგროვებულ ასობით ათას ტრაექტორიას სხვადასხვა გარემოდან. JAT-ის არქიტექტურა, თავისი უნიკალური ჩაშენების მექანიზმით, შექმნი
TRL წარმოგიდგენთ ახალ ალგორითმებს Vision Language მოდელების გასაუმჯობესებლად: MPO, GRPO და GSPO
Vision Language მოდელების (VLM) მუშაობის გაუმჯობესებაზე ფოკუსირებით, TRL-მა წარმოადგინა ინოვაციური ალგორითმები - შერეული პრეფერენციის ოპტიმიზაცია (MPO), ჯგუფური შედარებითი პოლიტიკის ოპტიმიზაცია (GRPO) და ჯგუფური თანმიმდევრობის პოლიტიკის ოპტიმიზაცია (GSPO). ეს მეთოდები სცილდება ტრადიციული DPO-ს ფარგლებს, რაც უზრუნველყოფს უფრო მდიდარი სიგნალების ამოღებას მონაცემებიდან, სტაბილურ წვრთნას და მნიშვნელოვან გაუმჯობესებას მოდელების პასუხებში, განსაკუთრებით მულტიმოდალურ ამოცანებში. მათი ინტეგრაცია TRL-ის
Hugging Face-ი და AMD ხელოვნური ინტელექტის განვითარებას AMD Instinct MI300 GPU-ების ინტეგრაციით აძლიერებენ
Hugging Face-ი და AMD აცხადებენ თანამშრომლობის გაფართოებას უახლესი თაობის AMD Instinct MI300 GPU სერვერების Hugging Face პლატფორმაში სრულფასოვანი ინტეგრაციის მიზნით. ეს ნაბიჯი დეველოპერებს საშუალებას მისცემს, მარტივად განათავსონ და მაქსიმალური წარმადობით გამოიყენონ ხელოვნური ინტელექტის მოდელები, კოდის შეცვლის გარეშე, ადგილობრივი გარემოდან დაწყებული Azure-ის საწარმოო ვირტუალურ მანქანებამდე. ინტეგრაცია მოიცავს CI/CD-ის გაუმჯობესებას, TGI-ის (text-generation-inference) ოპტიმიზაციას Meta Llama ოჯახი
TII Falcon 2-ს წარმოგიდგენთ: მცირე ზომის, მაღალეფექტური მრავალმოდალური AI მოდელები ღია კოდის საზოგადოებისთვის
TII უშვებს Falcon 2 მოდელების ახალ თაობას, რომელიც გამიზნულია ღია კოდის საზოგადოებისთვის გაუმჯობესებული შესრულების, მრავალმოდალური მხარდაჭერისა და უფრო დაბალი გამოთვლითი ხარჯების მქონე მცირე ზომის მოდელების მიწოდებაზე. ეს ინიციატივა მიზნად ისახავს AI-ის გამოყენებადობის გაზრდას და ახალი აპლიკაციების შემუშავების წახალისებას. Falcon 2 მოიცავს არა მხოლოდ ენობრივ (LLM), არამედ ვიზუალურ-ენობრივ (VLM) მოდელებსაც, რომლებსაც გამოსახულებების გაგება შეუძლიათ. მოდელი გაწვრთნილია ვრცელ მრავალენოვან მონაცემთა
LeRobotDataset v3.0: ახალი სტანდარტი რობოტების სწავლებისთვის Hugging Face-ისგან
Hugging Face წარმოგიდგენთ LeRobotDataset v3.0-ს, სტანდარტიზებულ მონაცემთა ნაკრების ფორმატს, რომელიც შექმნილია რობოტების სწავლების საჭიროებებისთვის. ის უზრუნველყოფს მულტიმოდალურ მონაცემებზე ერთიან წვდომას, მოიცავს გაუმჯობესებულ მეტამონაცემებს, სტრიმინგის ფუნქციონალურობას დიდი მოცულობის მონაცემებთან მუშაობისთვის და ადვილად ინტეგრირდება Hugging Face და PyTorch ეკოსისტემებთან. ეს სიახლე მნიშვნელოვან ეტაპს წარმოადგენს რობოტების სწავლების ხელმისაწვდომობის გაზრდის გზაზე.
LeRobotDataset v3.0: Hugging Face-ის ახალი სტანდარტი რობოტების სწავლისთვის
Hugging Face-მა წარმოადგინა LeRobotDataset v3.0, სტანდარტიზებული მონაცემთა ნაკრების ფორმატი რობოტების სწავლის სპეციფიკური საჭიროებების დასაკმაყოფილებლად. ის უზრუნველყოფს უნიფიცირებულ და მოსახერხებელ წვდომას სხვადასხვა მოდალობის რობოტულ მონაცემებზე, მათ შორის სენსორულ-მოტორულ მაჩვენებლებზე, კამერის ნაკადებზე და ტელეოპერაციის სტატუსზე. ახალი ვერსია მოიცავს მეტამონაცემების დეტალურ შენახვას, შეუფერხებლად ინტეგრირდება Hugging Face-ისა და PyTorch-ის ეკოსისტემებთან და მხარს უჭერს სტრიმინგის ფუნქციონალს
დოკუმენტების ხელოვნური ინტელექტი: OCR-დან დამუშავებამდე წამყვანი მოდელების გამოყენებით
ეს პოსტი იკვლევს დოკუმენტების ხელოვნურ ინტელექტს (Document AI), რომელიც მოიცავს მონაცემთა მეცნიერების სხვადასხვა ამოცანას, როგორიცაა ოპტიკური სიმბოლოების ამოცნობა (OCR), დოკუმენტების კლასიფიკაცია, განლაგების ანალიზი და დამუშავება (parsing). მასში წარმოდგენილია გამოყენების შემთხვევების ტაქსონომია, ხაზგასმულია საუკეთესო ღია კოდის მოდელები (მაგ., LayoutLM, Donut, DiT) და განხილულია ძირითადი ასპექტები, როგორიცაა ლიცენზირება, მონაცემთა მომზადება და შეფასების მეტრიკა. ტექსტი ხაზს უსვამს მულტიმოდალურ მ
Stability AI-მ Stable Diffusion 3 Medium წარადგინა: ახალი 2-მილიარდპარამეტრიანი მოდელი გაუმჯობესებული არქიტექტურითა და წარმადობით
Stability AI-მ გამოუშვა Stable Diffusion 3 Medium (SD3), 2 მილიარდი პარამეტრიანი ლატენტური დიფუზიური მოდელი, რომელიც განკუთვნილია ტექსტიდან გამოსახულების სინთეზისთვის. ის მოიცავს ინოვაციურ მულტიმოდალურ დიფუზიურ ტრანსფორმატორს (MMDiT) და სამ ტექსტის ენკოდერს, მათ შორის T5-v1.1-XXL-ს. SD3 იყენებს პირობითი ნაკადის შესატყვისობის ობიექტივს სწავლებისთვის და წარმოგიდგენთ ახალ FlowMatchEulerDiscreteScheduler-ს ინფერენსისთვის. Diffusers-ის ინტეგრაცია მოიცავს მეხსიერების ოპტიმიზაციებს, რაც მოდელს უფრო ფარ
Prezi Hugging Face-ის ექსპერტთა მხარდაჭერის პროგრამას უერთდება: ML პოტენციალის სრული გამოყენება
პრეზენტაციების ონლაინ ხელსაწყო Prezi, Hugging Face-ის ექსპერტთა მხარდაჭერის პროგრამას შეუერთდა, რათა მაქსიმალურად აითვისოს თანამედროვე მანქანური სწავლების (ML) შესაძლებლობები. ამ თანამშრომლობის ფარგლებში, Hugging Face ეხმარება Prezi-ს უფრო მცირე და ეფექტური ღია კოდის მოდელების ინტეგრირებაში, რაც განსაკუთრებით მნიშვნელოვანია მულტიმოდალური მოდელების მზარდი შესაძლებლობების ფონზე. Prezi-ის ბექენდ ინჟინერი, მატე ბორჩოკი, იზიარებს თავის გამოცდილებას პროგრამაში მონაწილეობის შესახებ, ხაზს უსვამს ექსპერტ
ProtST-ის განლაგება და დამატებითი წვრთნა Intel Gaudi 2 აქსელერატორებზე: უმაღლესი სიჩქარე ცილის მოდელირებისთვის
ცილოვანი ენის მოდელები (PLM-ები), კერძოდ ProtST, ცილის სტრუქტურისა და ფუნქციის პროგნოზირების მძლავრი საშუალებაა. Intel-მა და MILA-მ ProtST, მულტიმოდალური ენის მოდელი, ICML 2023-ზე წარადგინეს, რომელმაც სწრაფად მოიპოვა აღიარება. ამ სტატიაში განხილულია, თუ როგორ ხდება ProtST-ის ეფექტური ინფერენსი და დამატებითი წვრთნა Intel Gaudi 2 აქსელერატორებზე. შედეგები აჩვენებს 1.76-ჯერ დაჩქარებას ინფერენსისთვის და 2.92-ჯერ დაჩქარებას დამატებითი წვრთნისთვის NVIDIA A100-თან შედარებით, გაუმჯობესებული ხელმისაწვდომ
Hugging Face მონაცემთა ნაკრებების ძებნის ოთხ ახალ ფუნქციას წარმოგიდგენთ
Hugging Face განაგრძობს Dataset Hub-ის გაუმჯობესებას და Dataset Search-ისთვის ოთხ ახალ ფუნქციას აცხადებს. ეს სიახლეები მოიცავს მონაცემთა მოდალობის (ტიპის) მიხედვით ფილტრაციას, სტრიქონების რაოდენობის მიხედვით ძებნას, მონაცემთა ფორმატების ფილტრაციას და ბიბლიოთეკებთან თავსებადობის მიხედვით ძებნას, რაც მომხმარებლებს საშუალებას მისცემს, უფრო ეფექტურად იპოვონ სასურველი ღია მონაცემთა ნაკრებები.
ხელოვნური ინტელექტი 2026: ექსპერიმენტული ინსტრუმენტიდან საწარმოს ხერხემალამდე
2026 წელს ხელოვნური ინტელექტი ექსპერიმენტული ტექნოლოგიიდან გადაინაცვლებს საწარმოთა, კრეატიული ინდუსტრიებისა და მომხმარებლის გამოცდილების სტრატეგიულ ხერხემალში. აქცენტი გადავა მასშტაბიდან ეფექტურობასა და კონტექსტის მცოდნე სისტემებზე, რასაც ხელს შეუწყობს „მოაზროვნე მოდელების“ და მოდელის კონტექსტის პროტოკოლის (MCP) აღზევება. ხი გახდება ნამდვილი თანამშრომელი, რომელსაც შეუძლია გადაწყვეტილებების მიღება და მულტიმოდალური გაგება, ხოლო ღია კოდის მოდელები გააგრძელებენ კონკურენტული ლანდშაფტის ფორმირებას. ნდ
დიდი ენობრივი მოდელები და კიბერუსაფრთხოება: ახალი ფრონტი
დიდი ენობრივი მოდელები (დემ) და მულტიმოდალური ხელოვნური ინტელექტის სისტემები კრიტიკულ ბიზნეს პროცესებში ინტეგრირდა, რამაც ისინი როგორც მძლავრ უსაფრთხოების ინსტრუმენტებად, ასევე მაღალი ღირებულების სამიზნეებად აქცია. თავდამსხმელები უკვე იყენებენ ახალ ტექნიკას, როგორიცაა პრომპტების მოპარვა და AI აგენტების ბოროტად გამოყენება. ეს სტატია მიმოიხილავს ხელოვნური ინტელექტის შეტევებსა და თავდაცვას შორის მოსალოდნელ 'შეიარაღების რბოლას' და ხაზს უსვამს AI უსაფრთხოების, როგორც კიბერუსაფრთხოების სტრატეგიის ძირი
დიდი ენობრივი მოდელები და კიბერუსაფრთხოების ახალი გამოწვევები
დიდი ენობრივი მოდელები (დემ) და მულტიმოდალური ხელოვნური ინტელექტის სისტემები კრიტიკულ ბიზნეს პროცესებში ინტეგრირდა, რის გამოც ისინი, როგორც მძლავრი უსაფრთხოების ინსტრუმენტები, ისე მაღალი ღირებულების სამიზნეები გახდნენ. თავდამსხმელები უკვე აქტიურად იყენებენ მოდელებს შეზღუდვების გვერდის ავლით, იპარავენ პრომპტებს, ბოროტად იყენებენ ავტონომიურ AI აგენტებს და იარაღად აქცევენ ისეთ ხელსაწყოებს, როგორიცაა WormGPT და FraudGPT. უახლოესი წლები განისაზღვრება AI-ზე დაფუძნებულ შეტევებსა და AI-ზე დაფუძნებულ დაც
Gemini 3 Pro: ხელოვნური ინტელექტის ახალი პარტნიორობის ერა
Google-მა წარმოადგინა ახალი ხელოვნური ინტელექტის მოდელი, Gemini 3 Pro, რომელიც აღნიშნავს ხელოვნური ინტელექტის განვითარების ახალ ერას – ხაზოვანი გაუმჯობესებიდან ექსპონენციურ შესაძლებლობებზე გადასვლას. Gemini 3 Pro აღწერილია, როგორც კოგნიტური ძრავა, რომელსაც შეუძლია არა მხოლოდ დამუშავება და ჩეთი, არამედ აზროვნება და მოქმედება, რთული პრობლემების გადაჭრის მიზნით. მისი ძირითადი მახასიათებლები მოიცავს „სისტემა 2“-ის აზროვნებას, ნატიურ მულტიმოდალურობას, გაფართოებულ „სააგენტოს“ (Agency) ფუნქციებს გარე ი
Gemini 3 Pro: ხელოვნური ინტელექტის ახალი ერა – ჩეთბოტიდან კოგნიტურ ძრავამდე
Google-ის ახალი AI მოდელი, Gemini 3 Pro, წარმოგვიდგენს ხელოვნური ინტელექტის განვითარების რევოლუციურ ეტაპს. ის აღარ არის უბრალო ჩეთბოტი, არამედ კოგნიტური ძრავა, რომელიც შექმნილია აზროვნებისთვის, მრავალმხრივი მოქმედებისთვის და კომპლექსური პრობლემების გადასაჭრელად. მოდელი გამოირჩევა გაუმჯობესებული მსჯელობის უნარით, მშობლიური მულტიმოდალურობით (ტექსტი, ვიდეო, აუდიო, ვიზუალი), დამოუკიდებელი მოქმედების (Agency) შესაძლებლობით, გაფართოებული კონტექსტური მეხსიერებით და უსაფრთხოების ახალი მექანიზმებით.