Big Bench Audio: ახალი მონაცემთა ნაკრები აუდიო ენის მოდელების მსჯელობის შესაძლებლობების შესაფასებლად
კომპანია Artificial Analysis-მა გამოუშვა Big Bench Audio, ახალი მონაცემთა ნაკრები, რომელიც შექმნილია აუდიო ენის მოდელების მსჯელობის შესაძლებლობების შესაფასებლად. ეს ინოვაციური ნაკრები Big Bench Hard-ის კითხვებს აუდიო ფორმატში ადაპტირებს. პირველადი შედეგები, რომლებიც GPT-4o-სა და Gemini 1.5-ის სერიის მოდელებზე ჩატარდა, ავლენს მნიშვნელოვან „მეტყველების მსჯელობის ხარვეზს“: GPT-4o-ის სიზუსტე ტექსტურ ვერსიაში 92%-ს აღწევს, ხოლო მეტყველება-მეტყველებაზე შესრულებისას ის 66%-მდე ეცემა. ანალიზი მოიცავს მრ
ამ ანალიზის მხარდასაჭერად, Artificial Analysis აქვეყნებს Big Bench Audio-ს, ახალ შეფასების მონაცემთა ნაკრებს აუდიო ენის მოდელების მსჯელობის შესაძლებლობების შესაფასებლად. ეს მონაცემთა ნაკრები Big Bench Hard-ის კითხვებს – რომელიც მოწინავე მსჯელობის მკაცრი შემოწმებისთვისაა არჩეული – აუდიო დომენში ადაპტირებს. ეს პუბლიკაცია წარმოგიდგენთ Big Bench Audio მონაცემთა ნაკრებს GPT-4o-სა და Gemini 1.5 სერიის მოდელების პირველად საორიენტაციო (benchmark) შედეგებთან ერთად. ჩვენი ანალიზი იკვლევს ამ მოდელებს მრავალ მოდალობაში: მშობლიური მეტყველება-მეტყველებაზე, მეტყველება-ტექსტზე, ტექსტი-მეტყველებაზე და ტექსტი-ტექსტზე. შედეგების შეჯამებას წარმოგიდგენთ ქვემოთ და Artificial Analysis-ის ვებგვერდის ახალ „მეტყველება-მეტყველებაზე“ გვერდზე.
ჩვენი პირველადი შედეგები აჩვენებს მნიშვნელოვან „მეტყველების მსჯელობის ხარვეზს“: მაშინ როდესაც GPT-4o აღწევს 92%-იან სიზუსტეს მონაცემთა ნაკრების მხოლოდ ტექსტურ ვერსიაში, მისი მეტყველება-მეტყველებაზე შესრულება 66%-მდე ეცემა. Big Bench Audio მოიცავს 1,000 აუდიო კითხვას, შერჩეულს Big Bench Hard-ის ოთხი კატეგორიიდან, რომელთაგან თითოეული შეირჩა აუდიო შეფასებისთვის მათი ვარგისიანობის გამო. თითოეული კატეგორია 250 კითხვას შეიცავს, რაც ქმნის დაბალანსებულ მონაცემთა ნაკრებს, რომელიც თავს არიდებს ვიზუალურ ელემენტებზე ან ტექსტზე ძლიერ დამოკიდებულ დავალებებს, რამაც შესაძლოა ორაზროვნება გამოიწვიოს ვერბალიზაციისას. მონაცემთა ნაკრების თითოეული შეკითხვა შემდეგნაირად არის სტრუქტურირებული:
აუდიო ფაილები გენერირებული იქნა 23 სინთეზური ხმის გამოყენებით Artificial Analysis Speech Arena-ს წამყვანი ტექსტი-მეტყველებაზე მოდელებიდან. თითოეული აუდიო გენერაცია მკაცრად შემოწმდა ლევენშტეინის მანძილის გამოყენებით ტრანსკრიპციების მიხედვით, ხოლო კიდური შემთხვევები ხელით განიხილეს. მონაცემთა ნაკრების შექმნის შესახებ მეტი ინფორმაციისთვის იხილეთ მონაცემთა ნაკრების ბარათი. აუდიოს ზემოქმედების შესაფასებლად თითოეული მოდელის მსჯელობის შესრულებაზე, Big Bench Audio-ზე ოთხი განსხვავებული კონფიგურაცია გამოვცადეთ. ამ კონფიგურაციების საფუძველზე ჩავატარეთ თვრამეტი ექსპერიმენტი:
(ცხრილი 1 – ექსპერიმენტის კონფიგურაცია)
შენიშვნები: ყველა კონფიგურაციაში თანმიმდევრული და მასშტაბირებადი შეფასების უზრუნველსაყოფად, ჩვენ შევიმუშავეთ ავტომატური შეფასების სისტემა LLM Evaluator-ის გამოყენებით. ასე მუშაობს ის: LLM Evaluator-ს მიეწოდება კანდიდატი პასუხი, ოფიციალური პასუხი და ორიგინალური კითხვა, როგორც კონტექსტი, და მოთხოვნა აქვს კანდიდატი პასუხი მონიშნოს, როგორც სწორი ან არასწორი. ჩვენ ვიყენებთ Anthropic-ის Claude 3.5 Sonnet-ს (ოქტომბერი '24) LLM შემფასებლად Artificial Analysis-ზე ჩამოთვლილი Big Bench Audio ქულებისთვის.
LLM შემფასებლის მოთხოვნა (Prompt): ქვემოთ მოცემულია რამდენიმე საპასუხო მაგალითი.
მოდელი: GPT-4o, რეალურ დროში წინასწარი ნახვა (Realtime Preview)
შეტანა:
გამომავალი:
სწორია: დიახ
მოდელი: მეტყველება-მეტყველებაზე „პაიპლაინი“ (whisper, GPT-4o, tts-1)
შეტანა:
გამომავალი:
სწორია: დიახ
მოდელი: Gemini 1.5 Flash (სექტემბერი '24)
შეტანა:
გამომავალი:
სწორია: დიახ
მოდელი: GPT-4o, ChatCompletions აუდიო წინასწარი ნახვა
შეტანა:
გამომავალი:
სწორია: დიახ
მოდელი: Gemini 1.5 Pro (სექტემბერი '24)
შეტანა:
გამომავალი:
სწორია: დიახ
(სურათი 1 – შედეგების შეჯამება) ყველა წარმოდგენილი შედეგი წარმოადგენს საშუალო მაჩვენებლებს თითოეულ მონაცემთა ნაკრებზე ჩატარებული სამი დამოუკიდებელი შეფასების გაშვებიდან. ჩვენი ანალიზი ავლენს შესრულების მნიშვნელოვან ხარვეზს ტექსტურ მსჯელობასა და აუდიო მსჯელობას შორის. GPT-4o (აგვისტო '24) აღწევს 92%-იან სიზუსტეს მონაცემთა ნაკრების ტექსტი-ტექსტზე ვერსიაში, მაშინ როდესაც მისი მეტყველება-მეტყველებაზე ანალოგი (GPT-4o Realtime Preview ოქტომბერი '24) 66%-იან მაჩვენებელს აღწევს. ტექსტი-მეტყველებაზე კონფიგურაცია შუალედურ შესრულებას აჩვენებს 74%-ით, რაც მიუთითებს, რომ როგორც მეტყველების შეყვანა, ასევე მეტყველების გამომავალი ხელს უწყობს შესრულების ხარვეზს. ტრადიციული „პაიპლაინ“ მიდგომები (Whisper-ის გამოყენებით ტრანსკრიფციისთვის, GPT-4o (აგვისტო '24) მსჯელობისთვის და TTS-1 ხმის გენერაციისთვის) მინიმალურ დეგრადაციას აჩვენებს შესრულებაში წმინდა ტექსტის დამუშავებასთან შედარებით. ეს მიუთითებს, რომ აპლიკაციებისთვის, სადაც მსჯელობის სიზუსტე კრიტიკულია, „პაიპლაინ“ მიდგომები ამჟამად გვთავაზობს ოპტიმალურ ბალანსს შესრულებასა და აუდიო შესაძლებლობებს შორის.
ჩვენ ვვარაუდობთ, რომ ეს ხარვეზი დროთა განმავლობაში შემცირდება და გავაგრძელებთ ახალი მეტყველება-მეტყველებაზე მოდელების ტესტირებას Big Bench Audio-ს გამოყენებით. მალე დაელოდეთ განახლებას Google-ის Gemini 2.0 Flash-ისთვის მეტყველება-მეტყველებაზე რეჟიმით! მეტყველება-მეტყველებაზე მოდელების შემდგომი ანალიზისთვის იხილეთ Artificial Analysis-ის ვებგვერდის ახალი მეტყველება-მეტყველებაზე გვერდი: https://artificialanalysis.ai/speech-to-speech. განახლებებისთვის მოგვყევით Twitter-ზე და LinkedIn-ზე. მივესალმებით ნებისმიერ უკუკავშირს და ხელმისაწვდომი ვართ Twitter-ის შეტყობინებით, ასევე ჩვენი ვებგვერდის საკონტაქტო ფორმის მეშვეობით. მეტი სტატია ჩვენი ბლოგიდან · დარეგისტრირდით ან შეხვიდეთ კომენტარის დასატოვებლად.
თეგები:
#ხელოვნური ინტელექტი
#llm
#gpt-4o
#gemini
#მონაცემთა ნაკრები
#შეფასება
#artificial analysis
#big bench audio
#აუდიო ენის მოდელები
#მეტყველება-მეტყველებაზე
#მეტყველების მსჯელობის ხარვეზი
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი