LIVE
AI-ს გავლენა SaaS-ის ბიზნეს მოდელზე: „SaaSpocalypse“ თუ ახალი ერა? · Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე · Honor Magic V6: უთხელესი დასაკეცი ტელეფონი? პირველი შთაბეჭდილებები · Honor Magic V6: ყველაზე თხელი დასაკეცი სმარტფონი და მისი შთამბეჭდავი შესაძლებლობები · ZDNET-ის სანდოობა და MWC 2026: Honor-ის დასაკეცი ტელეფონი Magic V6 და ხელოვნური ინტელექტის მქონე „რობოტი ტელეფონი“ · MWC 2026: Xiaomi Pad 8 Pro Matte Glass – Android ტაბლეტის ახალი ეტალონი? · AI-ს გავლენა SaaS-ის ბიზნეს მოდელზე: „SaaSpocalypse“ თუ ახალი ერა? · Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე · Honor Magic V6: უთხელესი დასაკეცი ტელეფონი? პირველი შთაბეჭდილებები · Honor Magic V6: ყველაზე თხელი დასაკეცი სმარტფონი და მისი შთამბეჭდავი შესაძლებლობები · ZDNET-ის სანდოობა და MWC 2026: Honor-ის დასაკეცი ტელეფონი Magic V6 და ხელოვნური ინტელექტის მქონე „რობოტი ტელეფონი“ · MWC 2026: Xiaomi Pad 8 Pro Matte Glass – Android ტაბლეტის ახალი ეტალონი? ·
AI TIME.ge პროექტი

AI სიახლეები

სულ 4 სტატია · გვერდი 1 / 1

Anthropic-ის ჩეთბოტი Claude Apple App Store-ის რეიტინგების სათავეში მოექცა პენტაგონთან მოლაპარაკებებისა და მთავრობის ყურადღების ფონზე
ხელოვნური ინტელექტი 01 მარ

Anthropic-ის ჩეთბოტი Claude Apple App Store-ის რეიტინგების სათავეში მოექცა პენტაგონთან მოლაპარაკებებისა და მთავრობის ყურადღების ფონზე

Anthropic-ის AI ჩეთბოტმა Claude-მა, რომელიც პენტაგონთან მოლაპარაკებებისა და აშშ-ის მთავრობის ყურადღების ცენტრში აღმოჩნდა, Apple-ის აშშ-ის App Store-ის უფასო აპლიკაციების რეიტინგში პირველი ადგილი დაიკავა, გადაასწრო რა OpenAI-ის ChatGPT-ს. კომპანიამ ასევე დააფიქსირა მომხმარებლების რაოდენობის მნიშვნელოვანი ზრდა.

1 წთ კითხვა · 255 ნახვა
Math-Verify-ის დანერგვა: ღია LLM ლიდერბორდის რეიტინგების გადაფასება უფრო სამართლიანი შედარებებისთვის
ხელოვნური ინტელექტი 13 თებ

Math-Verify-ის დანერგვა: ღია LLM ლიდერბორდის რეიტინგების გადაფასება უფრო სამართლიანი შედარებებისთვის

Hugging Face-ის ღია LLM ლიდერბორდმა მნიშვნელოვანი განახლება განიცადა Math-Verify ინსტრუმენტის დანერგვით. ამ ახალმა სისტემამ ხელახლა შეაფასა ყველა 3,751 წარმოდგენილი მოდელი, რამაც გამოასწორა მათემატიკური ამოცანების შეფასების კრიტიკული პრობლემები. შედეგად, ბევრი მოდელის, განსაკუთრებით Qwen-ისა და DeepSeek-ის, ქულები მნიშვნელოვნად გაუმჯობესდა, ხოლო MATH ქვეჯგუფის ტოპ 20 რეიტინგი სრულად გადალაგდა, სადაც Nvidia-ს AceMath მოდელები ახლა დომინირებენ. ეს უზრუნველყოფს მსხვილი ენობრივი მოდელების (LLM) უფრო

1 წთ კითხვა · 86 ნახვა
MIT-ის კვლევა: დიდი ენის მოდელების (LLM) რეიტინგები საოცრად მგრძნობიარეა მომხმარებლის უკუკავშირის მიმართ
ტექნოლოგია 12 თებ

MIT-ის კვლევა: დიდი ენის მოდელების (LLM) რეიტინგები საოცრად მგრძნობიარეა მომხმარებლის უკუკავშირის მიმართ

MIT-ის მკვლევრებმა აღმოაჩინეს, რომ დიდი ენის მოდელების (LLM) რეიტინგული პლატფორმები საოცრად მგრძნობიარეა მომხმარებლის უკუკავშირის მიმართ. მათმა კვლევამ აჩვენა, რომ კრაუდსორსინგული მონაცემების მცირე ნაწილის ამოღებასაც კი შეუძლია რეიტინგების შეცვლა, რამაც შესაძლოა კომპანიები შეცდომაში შეიყვანოს საუკეთესო მოდელის არჩევისას. მკვლევრებმა შეიმუშავეს ეფექტური მეთოდი, რომელიც ავლენს შედეგების დამახინჯებაზე პასუხისმგებელ ინდივიდუალურ შეფასებებს, რაც ხაზს უსვამს რეიტინგების შეფასების უფრო მკაცრი სტრატეგიე

1 წთ კითხვა · 109 ნახვა
MIT-ის კვლევა: LLM-ის რეიტინგები მოულოდნელად მგრძნობიარეა მცირე მონაცემების მიმართ
ტექნოლოგია 12 თებ

MIT-ის კვლევა: LLM-ის რეიტინგები მოულოდნელად მგრძნობიარეა მცირე მონაცემების მიმართ

MIT-ის მკვლევარებმა აღმოაჩინეს, რომ დიდი ენობრივი მოდელების (LLM) რეიტინგის პლატფორმები ძალზე მგრძნობიარეა მომხმარებლის მცირე რაოდენობის შეფასებების მიმართ. ამან შესაძლოა კომპანიები შეცდომაში შეიყვანოს LLM-ის არჩევისას. მათ შეიმუშავეს სწრაფი მეთოდი, რომელიც ავლენს შედეგების დამახინჯებაზე პასუხისმგებელ „გავლენიან“ ხმებს და ხაზს უსვამს მოდელის შეფასების უფრო მკაცრი სტრატეგიების საჭიროებას.

1 წთ კითხვა · 116 ნახვა