სულ 1 სტატია · გვერდი 1 / 1
ხედვითი ენის მოდელები (VLM) არის ხელოვნური ინტელექტის მოდელები, რომლებსაც შეუძლიათ ერთდროულად ისწავლონ გამოსახულებებიდან და ტექსტებიდან, რაც მათ საშუალებას აძლევს შეასრულონ მრავალი დავალება, როგორიცაა ვიზუალურ კითხვებზე პასუხის გაცემა და გამოსახულების აღწერა. ისინი გენერაციული მოდელებია, რომლებიც იღებენ გამოსახულებისა და ტექსტის შეტანას და წარმოქმნიან ტექსტურ გამოსავალს. ამ მოდელებს გააჩნიათ კარგი „ნულოვანი-კადრის“ (zero-shot) შესაძლებლობები და გამოიყენება გამოსახულებებზე საუბრისთვის, დოკუმენტებ