Anthropic-ის ჩეთბოტი Claude Apple App Store-ის რეიტინგების სათავეში მოექცა პენტაგონთან მოლაპარაკებებისა და მთავრობის ყურადღების ფონზე
Anthropic-ის AI ჩეთბოტმა Claude-მა, რომელიც პენტაგონთან მოლაპარაკებებისა და აშშ-ის მთავრობის ყურადღების ცენტრში აღმოჩნდა, Apple-ის აშშ-ის App Store-ის უფასო აპლიკაციების რეიტინგში პირველი ადგილი დაიკავა, გადაასწრო რა OpenAI-ის ChatGPT-ს. კომპანიამ ასევე დააფიქსირა მომხმარებლების რაოდენობის მნიშვნელოვანი ზრდა.
Math-Verify-ის დანერგვა: ღია LLM ლიდერბორდის რეიტინგების გადაფასება უფრო სამართლიანი შედარებებისთვის
Hugging Face-ის ღია LLM ლიდერბორდმა მნიშვნელოვანი განახლება განიცადა Math-Verify ინსტრუმენტის დანერგვით. ამ ახალმა სისტემამ ხელახლა შეაფასა ყველა 3,751 წარმოდგენილი მოდელი, რამაც გამოასწორა მათემატიკური ამოცანების შეფასების კრიტიკული პრობლემები. შედეგად, ბევრი მოდელის, განსაკუთრებით Qwen-ისა და DeepSeek-ის, ქულები მნიშვნელოვნად გაუმჯობესდა, ხოლო MATH ქვეჯგუფის ტოპ 20 რეიტინგი სრულად გადალაგდა, სადაც Nvidia-ს AceMath მოდელები ახლა დომინირებენ. ეს უზრუნველყოფს მსხვილი ენობრივი მოდელების (LLM) უფრო
MIT-ის კვლევა: დიდი ენის მოდელების (LLM) რეიტინგები საოცრად მგრძნობიარეა მომხმარებლის უკუკავშირის მიმართ
MIT-ის მკვლევრებმა აღმოაჩინეს, რომ დიდი ენის მოდელების (LLM) რეიტინგული პლატფორმები საოცრად მგრძნობიარეა მომხმარებლის უკუკავშირის მიმართ. მათმა კვლევამ აჩვენა, რომ კრაუდსორსინგული მონაცემების მცირე ნაწილის ამოღებასაც კი შეუძლია რეიტინგების შეცვლა, რამაც შესაძლოა კომპანიები შეცდომაში შეიყვანოს საუკეთესო მოდელის არჩევისას. მკვლევრებმა შეიმუშავეს ეფექტური მეთოდი, რომელიც ავლენს შედეგების დამახინჯებაზე პასუხისმგებელ ინდივიდუალურ შეფასებებს, რაც ხაზს უსვამს რეიტინგების შეფასების უფრო მკაცრი სტრატეგიე
MIT-ის კვლევა: LLM-ის რეიტინგები მოულოდნელად მგრძნობიარეა მცირე მონაცემების მიმართ
MIT-ის მკვლევარებმა აღმოაჩინეს, რომ დიდი ენობრივი მოდელების (LLM) რეიტინგის პლატფორმები ძალზე მგრძნობიარეა მომხმარებლის მცირე რაოდენობის შეფასებების მიმართ. ამან შესაძლოა კომპანიები შეცდომაში შეიყვანოს LLM-ის არჩევისას. მათ შეიმუშავეს სწრაფი მეთოდი, რომელიც ავლენს შედეგების დამახინჯებაზე პასუხისმგებელ „გავლენიან“ ხმებს და ხაზს უსვამს მოდელის შეფასების უფრო მკაცრი სტრატეგიების საჭიროებას.