წლების განმავლობაში, დიდი ენობრივი მოდელები (LLM) გარდამტეხ ტექნოლოგიად იქცა, რომელსაც უდიდესი პოტენციალი აქვს ჯანდაცვის სხვადასხვა ასპექტის რევოლუციონიზაციისთვის. ამ მოდელებმა, როგორებიცაა GPT-3, GPT-4 და Med-PaLM 2, აჩვენეს საყურადღებო შესაძლებლობები ადამიანის მსგავსი ტექსტის გაგებასა და გენერირებაში, რაც მათ ღირებულ ინსტრუმენტებად აქცევს რთული სამედიცინო ამოცანების გადასაჭრელად და პაციენტის მოვლის გასაუმჯობესებლად. მათ მნიშვნელოვანი პერსპექტივები გამოავლინეს სხვადასხვა სამედიცინო აპლიკაციაში, როგორიცაა სამედიცინო კითხვა-პასუხის (QA) სისტემები, დიალოგის სისტემები და ტექსტის გენერირება. უფრო მეტიც, ელექტრონული ჯანმრთელობის ჩანაწერების (EHR), სამედიცინო ლიტერატურისა და პაციენტების მიერ გენერირებული მონაცემების ექსპონენციალური ზრდის ფონზე, LLM-ებს შეუძლიათ დაეხმარონ ჯანდაცვის პროფესიონალებს ღირებული ინფორმაციის მოპოვებაში და ინფორმირებული გადაწყვეტილებების მიღებაში. თუმცა, მიუხედავად დიდი ენობრივი მოდელების (LLM) უზარმაზარი პოტენციალისა ჯანდაცვაში, არსებობს მნიშვნელოვანი და კონკრეტული გამოწვევები, რომლებიც უნდა გადაიჭრას. როდესაც მოდელები გამოიყენება გასართობი, სასაუბრო ასპექტებისთვის, შეცდომებს მცირე შედეგები მოყვება; თუმცა, ეს ასე არ არის სამედიცინო სფეროში გამოყენებისას, სადაც არასწორმა ახსნამ და პასუხებმა შეიძლება მძიმე შედეგები გამოიწვიოს პაციენტის მოვლისა და მკურნალობისთვის. ენობრივი მოდელების მიერ მოწოდებული ინფორმაციის სიზუსტე და სანდოობა შეიძლება იყოს სიცოცხლისა და სიკვდილის საკითხი, რადგან მას შეუძლია პოტენციურად იმოქმედოს ჯანდაცვის გადაწყვეტილებებზე, დიაგნოზსა და მკურნალობის გეგმებზე. მაგალითად, სამედიცინო შეკითხვაზე (იხილეთ ქვემოთ), GPT-3-მ არასწორად ურჩია ტეტრაციკლინი ორსულ პაციენტს, მიუხედავად იმისა, რომ სწორად განმარტა მისი უკუჩვენება ნაყოფისთვის პოტენციური ზიანის გამო. ამ არასწორი რეკომენდაციის გათვალისწინებამ შეიძლება გამოიწვიოს ბავშვის ძვლის ზრდის პრობლემები. ჯანდაცვაში LLM-ების ძალის სრულად გამოსაყენებლად, გადამწყვეტია მოდელების შემუშავება და შეფასება სამედიცინო სფეროსთვის სპეციალურად შექმნილი სისტემის გამოყენებით. ამ სისტემამ უნდა გაითვალისწინოს ჯანდაცვის მონაცემებისა და აპლიკაციების უნიკალური მახასიათებლები და მოთხოვნები. Medical-LLM-ების შეფასების მეთოდების შემუშავება არ არის მხოლოდ აკადემიური ინტერესის საგანი, არამედ პრაქტიკული მნიშვნელობის, იმ რეალური რისკების გათვალისწინებით, რასაც ისინი ქმნიან ჯანდაცვის სექტორში. „Open Medical-LLM Leaderboard“-ის მიზანია ამ გამოწვევებისა და შეზღუდვების გადაჭრა სტანდარტიზებული პლატფორმის შეთავაზებით, რომელიც განკუთვნილია სხვადასხვა დიდი ენობრივი მოდელის მუშაობის შესაფასებლად და შესადარებლად მრავალფეროვან სამედიცინო ამოცანებსა და მონაცემთა ბაზებზე. თითოეული მოდელის სამედიცინო ცოდნისა და კითხვა-პასუხის შესაძლებლობების ყოვლისმომცველი შეფასების შეთავაზებით, ლიდერბორდის მიზანია უფრო ეფექტური და სანდო სამედიცინო LLM-ების შემუშავების ხელშეწყობა. ეს პლატფორმა მკვლევრებსა და პრაქტიკოსებს საშუალებას აძლევს, გამოავლინონ სხვადასხვა მიდგომის ძლიერი და სუსტი მხარეები, ხელი შეუწყონ სფეროში შემდგომ განვითარებას და საბოლოო ჯამში, წვლილი შეიტანონ პაციენტის უკეთეს მოვლასა და შედეგებში. Medical-LLM Leaderboard მოიცავს მრავალფეროვან ამოცანებს და სიზუსტეს იყენებს, როგორც მისი შეფასების ძირითად მეტრიკას (სიზუსტე ზომავს ენობრივი მოდელის მიერ მოწოდებული სწორი პასუხების პროცენტულ მაჩვენებელს სხვადასხვა სამედიცინო QA მონაცემთა ბაზებში). MedQA მონაცემთა ბაზა შედგება მრავალჯერადი არჩევანის კითხვებისგან, რომლებიც აღებულია შეერთებული შტატების სამედიცინო ლიცენზირების გამოცდიდან (USMLE). ის მოიცავს ზოგად სამედიცინო ცოდნას და შეიცავს 11,450 შეკითხვას განვითარების ნაკრებში და 1,273 შეკითხვას ტესტირების ნაკრებში. თითოეულ შეკითხვას აქვს 4 ან 5 სავარაუდო პასუხი, და მონაცემთა ბაზა შექმნილია სამედიცინო ცოდნისა და მსჯელობის უნარების შესაფასებლად, რომლებიც საჭიროა შეერთებულ შტატებში სამედიცინო ლიცენზირებისთვის. MedMCQA არის ფართომასშტაბიანი მრავალჯერადი არჩევანის QA მონაცემთა ბაზა, რომელიც მიღებულია ინდოეთის სამედიცინო მისაღები გამოცდებიდან (AIIMS/NEET). ის მოიცავს 2.4 ათას ჯანდაცვის თემას და 21 სამედიცინო საგანს, 187,000-ზე მეტი შეკითხვით განვითარების ნაკრებში და 6,100 შეკითხვით ტესტირების ნაკრებში. თითოეულ შეკითხვას აქვს 4 სავარაუდო პასუხი და თან ახლავს ახსნა. MedMCQA აფასებს მოდელის ზოგად სამედიცინო ცოდნასა და მსჯელობის შესაძლებლობებს. PubMedQA არის დახურული დომენის QA მონაცემთა ბაზა, სადაც თითოეულ შეკითხვაზე პასუხის გაცემა შესაძლებელია თანდართული კონტექსტის (PubMed-ის რეფერატი) დახმარებით. იგი შედგება 1,000 ექსპერტის მიერ ეტიკეტირებული კითხვა-პასუხის წყვილისგან. თითოეულ შეკითხვას თან ახლავს PubMed-ის რეფერატი, როგორც კონტექსტი, და ამოცანაა დიახ/არა/შესაძლოა პასუხის გაცემა რეფერატში მოცემული ინფორმაციის საფუძველზე. მონაცემთა ბაზა დაყოფილია 500 შეკითხვად განვითარებისთვის და 500 შეკითხვად ტესტირებისთვის. PubMedQA აფასებს მოდელის უნარს, გაიგოს და იმსჯელოს სამეცნიერო ბიომედიცინურ ლიტერატურაზე. MMLU ბენჩმარკი (Measuring Massive Multitask Language Understanding) მოიცავს მრავალჯერადი არჩევანის კითხვებს სხვადასხვა დომენიდან. Open Medical-LLM Leaderboard-ისთვის ჩვენ ვფოკუსირდებით იმ ქვეჯგუფებზე, რომლებიც ყველაზე მეტად უკავშირდება სამედიცინო ცოდნას: MMLU-ის თითოეული ქვეჯგუფი შედგება მრავალჯერადი არჩევანის კითხვებისგან 4 სავარაუდო პასუხით და შექმნილია მოდელის მიერ სპეციფიკური სამედიცინო და ბიოლოგიური დომენების გაგების შესაფასებლად. Open Medical-LLM Leaderboard გთავაზობთ მოდელის მუშაობის მყარ შეფასებას სამედიცინო ცოდნისა და მსჯელობის სხვადასხვა ასპექტში. „Open Medical-LLM Leaderboard“ აფასებს სხვადასხვა დიდი ენობრივი მოდელის მუშაობას.