ამ ანალიზის მხარდასაჭერად, Artificial Analysis აქვეყნებს Big Bench Audio-ს, ახალ შეფასების მონაცემთა ნაკრებს აუდიო ენის მოდელების მსჯელობის შესაძლებლობების შესაფასებლად. ეს მონაცემთა ნაკრები Big Bench Hard-ის კითხვებს – რომელიც მოწინავე მსჯელობის მკაცრი შემოწმებისთვისაა არჩეული – აუდიო დომენში ადაპტირებს. ეს პუბლიკაცია წარმოგიდგენთ Big Bench Audio მონაცემთა ნაკრებს GPT-4o-სა და Gemini 1.5 სერიის მოდელების პირველად საორიენტაციო (benchmark) შედეგებთან ერთად. ჩვენი ანალიზი იკვლევს ამ მოდელებს მრავალ მოდალობაში: მშობლიური მეტყველება-მეტყველებაზე, მეტყველება-ტექსტზე, ტექსტი-მეტყველებაზე და ტექსტი-ტექსტზე. შედეგების შეჯამებას წარმოგიდგენთ ქვემოთ და Artificial Analysis-ის ვებგვერდის ახალ „მეტყველება-მეტყველებაზე“ გვერდზე. ჩვენი პირველადი შედეგები აჩვენებს მნიშვნელოვან „მეტყველების მსჯელობის ხარვეზს“: მაშინ როდესაც GPT-4o აღწევს 92%-იან სიზუსტეს მონაცემთა ნაკრების მხოლოდ ტექსტურ ვერსიაში, მისი მეტყველება-მეტყველებაზე შესრულება 66%-მდე ეცემა. Big Bench Audio მოიცავს 1,000 აუდიო კითხვას, შერჩეულს Big Bench Hard-ის ოთხი კატეგორიიდან, რომელთაგან თითოეული შეირჩა აუდიო შეფასებისთვის მათი ვარგისიანობის გამო. თითოეული კატეგორია 250 კითხვას შეიცავს, რაც ქმნის დაბალანსებულ მონაცემთა ნაკრებს, რომელიც თავს არიდებს ვიზუალურ ელემენტებზე ან ტექსტზე ძლიერ დამოკიდებულ დავალებებს, რამაც შესაძლოა ორაზროვნება გამოიწვიოს ვერბალიზაციისას. მონაცემთა ნაკრების თითოეული შეკითხვა შემდეგნაირად არის სტრუქტურირებული: აუდიო ფაილები გენერირებული იქნა 23 სინთეზური ხმის გამოყენებით Artificial Analysis Speech Arena-ს წამყვანი ტექსტი-მეტყველებაზე მოდელებიდან. თითოეული აუდიო გენერაცია მკაცრად შემოწმდა ლევენშტეინის მანძილის გამოყენებით ტრანსკრიპციების მიხედვით, ხოლო კიდური შემთხვევები ხელით განიხილეს. მონაცემთა ნაკრების შექმნის შესახებ მეტი ინფორმაციისთვის იხილეთ მონაცემთა ნაკრების ბარათი. აუდიოს ზემოქმედების შესაფასებლად თითოეული მოდელის მსჯელობის შესრულებაზე, Big Bench Audio-ზე ოთხი განსხვავებული კონფიგურაცია გამოვცადეთ. ამ კონფიგურაციების საფუძველზე ჩავატარეთ თვრამეტი ექსპერიმენტი: (ცხრილი 1 – ექსპერიმენტის კონფიგურაცია) შენიშვნები: ყველა კონფიგურაციაში თანმიმდევრული და მასშტაბირებადი შეფასების უზრუნველსაყოფად, ჩვენ შევიმუშავეთ ავტომატური შეფასების სისტემა LLM Evaluator-ის გამოყენებით. ასე მუშაობს ის: LLM Evaluator-ს მიეწოდება კანდიდატი პასუხი, ოფიციალური პასუხი და ორიგინალური კითხვა, როგორც კონტექსტი, და მოთხოვნა აქვს კანდიდატი პასუხი მონიშნოს, როგორც სწორი ან არასწორი. ჩვენ ვიყენებთ Anthropic-ის Claude 3.5 Sonnet-ს (ოქტომბერი '24) LLM შემფასებლად Artificial Analysis-ზე ჩამოთვლილი Big Bench Audio ქულებისთვის. LLM შემფასებლის მოთხოვნა (Prompt): ქვემოთ მოცემულია რამდენიმე საპასუხო მაგალითი. მოდელი: GPT-4o, რეალურ დროში წინასწარი ნახვა (Realtime Preview) შეტანა: გამომავალი: სწორია: დიახ მოდელი: მეტყველება-მეტყველებაზე „პაიპლაინი“ (whisper, GPT-4o, tts-1) შეტანა: გამომავალი: სწორია: დიახ მოდელი: Gemini 1.5 Flash (სექტემბერი '24) შეტანა: გამომავალი: სწორია: დიახ მოდელი: GPT-4o, ChatCompletions აუდიო წინასწარი ნახვა შეტანა: გამომავალი: სწორია: დიახ მოდელი: Gemini 1.5 Pro (სექტემბერი '24) შეტანა: გამომავალი: სწორია: დიახ (სურათი 1 – შედეგების შეჯამება) ყველა წარმოდგენილი შედეგი წარმოადგენს საშუალო მაჩვენებლებს თითოეულ მონაცემთა ნაკრებზე ჩატარებული სამი დამოუკიდებელი შეფასების გაშვებიდან. ჩვენი ანალიზი ავლენს შესრულების მნიშვნელოვან ხარვეზს ტექსტურ მსჯელობასა და აუდიო მსჯელობას შორის. GPT-4o (აგვისტო '24) აღწევს 92%-იან სიზუსტეს მონაცემთა ნაკრების ტექსტი-ტექსტზე ვერსიაში, მაშინ როდესაც მისი მეტყველება-მეტყველებაზე ანალოგი (GPT-4o Realtime Preview ოქტომბერი '24) 66%-იან მაჩვენებელს აღწევს. ტექსტი-მეტყველებაზე კონფიგურაცია შუალედურ შესრულებას აჩვენებს 74%-ით, რაც მიუთითებს, რომ როგორც მეტყველების შეყვანა, ასევე მეტყველების გამომავალი ხელს უწყობს შესრულების ხარვეზს. ტრადიციული „პაიპლაინ“ მიდგომები (Whisper-ის გამოყენებით ტრანსკრიფციისთვის, GPT-4o (აგვისტო '24) მსჯელობისთვის და TTS-1 ხმის გენერაციისთვის) მინიმალურ დეგრადაციას აჩვენებს შესრულებაში წმინდა ტექსტის დამუშავებასთან შედარებით. ეს მიუთითებს, რომ აპლიკაციებისთვის, სადაც მსჯელობის სიზუსტე კრიტიკულია, „პაიპლაინ“ მიდგომები ამჟამად გვთავაზობს ოპტიმალურ ბალანსს შესრულებასა და აუდიო შესაძლებლობებს შორის. ჩვენ ვვარაუდობთ, რომ ეს ხარვეზი დროთა განმავლობაში შემცირდება და გავაგრძელებთ ახალი მეტყველება-მეტყველებაზე მოდელების ტესტირებას Big Bench Audio-ს გამოყენებით. მალე დაელოდეთ განახლებას Google-ის Gemini 2.0 Flash-ისთვის მეტყველება-მეტყველებაზე რეჟიმით! მეტყველება-მეტყველებაზე მოდელების შემდგომი ანალიზისთვის იხილეთ Artificial Analysis-ის ვებგვერდის ახალი მეტყველება-მეტყველებაზე გვერდი: https://artificialanalysis.ai/speech-to-speech. განახლებებისთვის მოგვყევით Twitter-ზე და LinkedIn-ზე. მივესალმებით ნებისმიერ უკუკავშირს და ხელმისაწვდომი ვართ Twitter-ის შეტყობინებით, ასევე ჩვენი ვებგვერდის საკონტაქტო ფორმის მეშვეობით. მეტი სტატია ჩვენი ბლოგიდან · დარეგისტრირდით ან შეხვიდეთ კომენტარის დასატოვებლად.