კიდევ ერთი კვირა, კიდევ ერთი „ჭკვიანი“ მოდელი — ამჯერად Google-ისგან, რომელმაც ახლახან გამოუშვა Gemini 3.1 Pro. Gemini 3-მა ნოემბერში გამოშვების შემდეგ რამდენიმე კონკურენტი მოდელი აჯობა, მათ შორის Copilot-ი ჩვენს შიდა ტესტებში, და ზოგადად მომხმარებლების მოწონება დაიმსახურა. Google-ის განცხადებით, ხუთშაბათს წარდგენილმა Gemini-ის უახლესმა მოდელმა ტესტირებისას მიაღწია „3 Pro-ს მსჯელობის შესაძლებლობის ორჯერ მეტ გაუმჯობესებას“, რასაც ადასტურებს მისი 77.1%-იანი შედეგი ARC-AGI-2 ბენჩმარკზე „სრულიად ახალი ლოგიკური შაბლონებისთვის“. უახლესი მოდელი გასულ კვირას Gemini 3 Deep Think-ის „მნიშვნელოვან განახლებას“ მოჰყვა, რომელმაც Google-ის თქმით, ახალი შესაძლებლობები შეიძინა ქიმიასა და ფიზიკაში, ასევე მიღწევები მათემატიკასა და კოდირებაში. კომპანიამ განაცხადა, რომ Gemini 3 Deep Think-ის განახლება შეიქმნა „რთული კვლევითი გამოწვევების“ გადასაჭრელად — სადაც პრობლემებს ხშირად აკლია მკაფიო მითითებები ან ერთი სწორი გადაწყვეტილება, ხოლო მონაცემები ხშირად არეული ან არასრულია. Google-ის განცხადებით, Gemini 3.1 Pro ამ სამეცნიერო ინვესტიციის საფუძველია და მოდელს უწოდა „განახლებული ძირითადი ინტელექტი, რომელიც ამ მიღწევებს შესაძლებელს ხდის“. გასული წლის ბოლოს, Gemini 3-მა Humanity's Last Exam (HLE) ბენჩმარკ ტესტზე ყველა არსებულ მოდელს შორის 38.3%-იანი ახალი რეკორდი დაამყარა. HLE შეიქმნა ინდუსტრიული სტანდარტების ბენჩმარკების მზარდი დაძლევადობის საწინააღმდეგოდ და მოდელების პროგრესის უკეთ გასაზომად ადამიანურ შესაძლებლობებთან შედარებით, როგორც უფრო მკაცრი ტესტი, თუმცა მხოლოდ ბენჩმარკები არ არის საკმარისი შესრულების დასადგენად. Google-ის თანახმად, Gemini 3.1 Pro ახლა აჭარბებს ამ შედეგს 44.4%-ით. Deep Think-ის განახლებამ ტექნიკურად უფრო მაღალი, 48.4% ქულა დააგროვა, მაგრამ ეს რეჟიმია და არა თავად ხელოვნური ინტელექტის მოდელი, ამიტომაც ის იყენებს უფრო ხანგრძლივ ინფერენციის დროს უკეთესი მსჯელობის შესრულებისთვის. ანალოგიურად, Deep Think-ის განახლებამ ARC-AGI-2 ლოგიკურ ბენჩმარკზე 84.6% ქულა დააგროვა — რაც უფრო მაღალია, ვიდრე 3.1 Pro-ს ზემოხსენებული 77.1%. ვინაიდან 3.1 Pro განკუთვნილია ყოველდღიური გამოყენებისთვის, მისი ბენჩმარკები მაინც აღსანიშნავია Deep Think-თან შედარებით, იმის გათვალისწინებით, რომ ეს რეჟიმი განკუთვნილია უფრო რთული სამეცნიერო და საინჟინრო ამოცანებისთვის. ყოველივე ზემოთქმულის მიუხედავად, Anthropic-ის Claude Opus 4.6 კვლავ ლიდერობს ხელოვნური ინტელექტის უსაფრთხოების ცენტრის (CAIS) ტექსტური შესაძლებლობების რეიტინგში (მსჯელობისა და სხვა ტექსტური შეკითხვებისთვის), რომელიც HLE-ის გარდა, სხვა შესაბამის ბენჩმარკის ქულებსაც აჯამებს. CAIS-ის რისკების შეფასების რეიტინგის მიხედვით, Anthropic-ის Opus 4.5, Sonnet 4.5 და Opus 4.6 ასევე აჯობებენ Gemini 3-ს უსაფრთხოების თვალსაზრისით. ბენჩმარკის რეკორდების მიღმა, მოდელის სასიცოცხლო ციკლი არ სრულდება ხმაურიანი გამოშვებით. ხელოვნური ინტელექტის განვითარების ამჟამინდელი ტემპით, ახალი მოდელები შთამბეჭდავია მხოლოდ კონკურენტებთან შედარებით — დრო და ტესტირება გვიჩვენებს, სად აღემატება ან სად ჩამორჩება 3.1 Pro. Gemini 3 ახალ მოდელს მყარ საფუძველს უქმნის, მაგრამ ეს შეიძლება მხოლოდ მანამდე გაგრძელდეს, სანამ შემდეგი ლაბორატორია არ გამოუშვებს უახლეს განახლებას. „ტესტის შედეგები მიუთითებს, რომ მას მნიშვნელოვანი გაუმჯობესება აქვს Gemini 3-თან შედარებით, და Gemini 3 საკმაოდ კარგი იყო, მაგრამ ვფიქრობ, რომ ამას მაშინვე ვერ გავიგებთ, და ის ჯერჯერობით მხოლოდ უფრო ძვირიან გეგმებშია ხელმისაწვდომი,“ — განაცხადა ZDNET-ის უფროსმა რედაქტორმა დევიდ გევირცმა გამოშვების შესახებ. „GPT 5.3-ის დრო ჯერ არ დამდგარა, და ვფიქრობ, როცა ეს მოხდება, გვექნება განახლებების უფრო უნივერსალური ნაკრები, რომელსაც შეგვეძლება ხელახლა მივუდგეთ.“ სანამ ამ მოდელს ველოდებით, გევირცმა შეისწავლა GPT-5.3-Codex, OpenAI-ის უახლესი კოდირებაზე ორიენტირებული გამოშვება, რომელმაც ცნობილად ხელი შეუწყო საკუთარი თავის შექმნას. დღეიდან დეველოპერებს შეუძლიათ Gemini 3.1 Pro-ს წინასწარი ვერსიის წვდომა Google-ის AI Studio-ს, Android Studio-ს, Google Antigravity-ს და Gemini CLI-ის API-ის მეშვეობით. კორპორატიულ კლიენტებს შეუძლიათ მისი გამოცდა Vertex AI-სა და Gemini Enterprise-ში, ხოლო ჩვეულებრივ მომხმარებლებს მისი პოვნა NotebookLM-სა და Gemini აპლიკაციაში შეუძლიათ.