Capital Fund Management (CFM) არის ალტერნატიული ინვესტიციების მართვის ფირმა, რომლის სათავო ოფისი პარიზში მდებარეობს. მას ასევე აქვს გუნდები ნიუ-იორკსა და ლონდონში, რომლებიც ამჟამად 15.5 მილიარდი დოლარის აქტივებს ზედამხედველობენ. ფინანსებთან მიმართებაში სამეცნიერო მიდგომის გამოყენებით, CFM რაოდენობრივ და სისტემურ მეთოდებს იყენებს უმაღლესი საინვესტიციო სტრატეგიების შესამუშავებლად. CFM თანამშრომლობს Hugging Face-ის ექსპერტთა მხარდაჭერის გუნდთან, რათა მუდმივად იყოს ინფორმირებული მანქანური სწავლების უახლესი მიღწევების შესახებ და გამოიყენოს ღია წყაროს ტექნოლოგიის ძალა თავისი ფართო სპექტრის ფინანსური აპლიკაციებისთვის. თანამშრომლობის ერთ-ერთი მთავარი მიზანი იყო იმის შესწავლა, თუ როგორ შეუძლია CFM-ს ეფექტურად გამოიყენოს ღია წყაროს დიდი ენობრივი მოდელები (LLMs) არსებული მანქანური სწავლების გამოყენების შემთხვევების გასაუმჯობესებლად. რაოდენობრივი ჰეჯ-ფონდები უზარმაზარ მონაცემთა მასივებს ეყრდნობიან კონკრეტული ფინანსური პროდუქტების ყიდვა-გაყიდვის შესახებ გადაწყვეტილებების მისაღებად. ფინანსური ბაზრების სტანდარტული მონაცემთა წყაროების (მაგ., ფასები) გარდა, ჰეჯ-ფონდები სულ უფრო ხშირად იღებენ ინფორმაციას ალტერნატიული მონაცემებიდან, როგორიცაა ტექსტური ინფორმაცია საინფორმაციო სტატიებიდან. საინფორმაციო მასალების სრულად ავტომატიზირებულ სავაჭრო სტრატეგიებში ინტეგრაციის ერთ-ერთი მთავარი გამოწვევაა სტატიებში მოხსენიებული პროდუქტების ან სუბიექტების (მაგ., კომპანიები, აქციები, ვალუტები) ზუსტი იდენტიფიცირება. მიუხედავად იმისა, რომ CFM-ის მონაცემთა პროვაიდერები ამ ტეგებს აწვდიან, ისინი შეიძლება იყოს არასრული და საჭიროებდეს დამატებით ვალიდაციას. CFM-მა ფინანსური სუბიექტების ამოცნობის გასაუმჯობესებლად რამდენიმე მიდგომა შეისწავლა, მათ შორის zero-shot NER LLM-ების და უფრო მცირე მოდელების გამოყენებით, LLM-ის დახმარებით მონაცემთა დატეგვა Hugging Face Inference Endpoints-ისა და Argilla-ს მეშვეობით, და მცირე მოდელების 'fine-tuning' (დაზუსტება) კურირებულ მონაცემთა ნაკრებებზე. ეს მიდგომები არა მხოლოდ იყენებს დიდი მოდელების მრავალფეროვნებას, არამედ აგვარებს ხარჯებისა და მასშტაბურობის გამოწვევებს რეალურ ფინანსურ აპლიკაციებში. ღია წყაროს მოდელებს შორის, Meta-ს Llama 3.1 სერია გამოირჩა თავისი მაღალი წარმადობით ბენჩმარკებში, რაც მას საუკეთესო არჩევანს ხდის სინთეზური ანოტაციების გენერირებისთვის. ეს LLM-ები გადამწყვეტი იყო მაღალი ხარისხის დატეგილი მონაცემთა ნაკრებების შესაქმნელად, აერთიანებდა ავტომატიზაციას და ადამიანის ექსპერტიზას დატეგვის პროცესის გასამარტივებლად და ფინანსურ NER ამოცანებში მოდელის წარმადობის გასაუმჯობესებლად. ამ გამოყენების შემთხვევაში ჩვენი მიზანი იყო კომპანიების სახელების ამოღება საინფორმაციო სათაურებიდან Financial News and Stock Price Integration Dataset (FNSPID)-დან. იგი შედგება საინფორმაციო სათაურებისა და სტატიებისგან, რომლებიც დაკავშირებულია შესაბამის საფონდო სიმბოლოებთან და მიღებულია რამდენიმე წყაროდან, როგორიცაა Bloomberg, Reuters, Benzinga და სხვა. სხვადასხვა საინფორმაციო წყაროს ანალიზის შემდეგ, აღმოვაჩინეთ, რომ Benzinga-დან მიღებულ ამბებში საფონდო სიმბოლოს დაკარგული მნიშვნელობები არ იყო. მონაცემთა ამ ქვეჯგუფში დაახლოებით 900 ათასი ნიმუშია. შედეგად, ჩვენ გადავწყვიტეთ, რომ ჩვენი მონაცემთა ნაკრები Benzinga-ს სათაურებამდე დაგვეყვანა, უფრო თანმიმდევრული და სანდო ანალიზისთვის. სხვადასხვა მიდგომის ეფექტურად შესადარებლად, პირველ რიგში, საჭიროა სანდო მონაცემთა ნაკრების კონსოლიდაცია, რომელიც საფუძვლად დაედება კანდიდატი მეთოდების შეფასებას. ეს მონაცემთა ნაკრები გამოყენებული იქნება როგორც მოდელების წარმადობის შესამოწმებლად zero-shot გარემოში, ასევე fine-tuning-ისთვის საბაზისო მონაცემად. ჩვენ გამოვიყენეთ Llama-ს დახმარებით მონაცემთა დატეგვა, რათა გაგვემარტივებინა და გაგვეუმჯობესებინა ანოტაციის პროცესი Llama 3.1-ის მიერ მონაცემთა ნაკრების ნიმუშებისთვის ტეგების გენერირებით. ეს ავტომატურად გენერირებული ტეგები შემდეგ ხელით იქნა განხილული (გადამოწმებული) ღია წყაროს მონაცემთა ანოტაციის პლატფორმა Argilla-ს გამოყენებით. ამ მიდგომამ საშუალება მოგვცა დაგვჩქარებინა დატეგვის პროცესი, ანოტაციების ხარისხის უზრუნველყოფის პარალელურად. Llama3.1-70-Instruct განთავსებაზე უსაფრთხო და სწრაფი წვდომის მისაღებად, ჩვენ Hugging Face Inference Endpoints ავირჩიეთ. Hugging Face Inference Endpoints გთავაზობთ მარტივ და უსაფრთხო გადაწყვეტას მანქანური სწავლების მოდელების საწარმოო გარემოში განთავსებისთვის. ისინი დეველოპერებსა და მონაცემთა მეცნიერებს საშუალებას აძლევენ შექმნან AI აპლიკაციები ინფრასტრუქტურის მართვის საჭიროების გარეშე, განთავსებას სულ რამდენიმე დაწკაპუნებით ამარტივებენ. Inference Endpoints-ზე წვდომისთვის ჩვენ შევედით როგორც CapitalFundManagement ორგანიზაციის წევრი Hugging Face Hub-ზე, შემდეგ კი სერვისზე გადავედით მისამართზე: https://ui.endpoints.huggingface.co. ახალი განთავსების დასაწყებად, ვაჭერთ ღილაკს 'New' და შემდეგ ვირჩევთ 'meta-llama/Llama-3.1-70B-Instruct'. Inference Endpoints-ის ინტერფეისში ენდპოინტის შექმნისას შეგიძლიათ აირჩიოთ, თუ რომელ ღრუბლოვან პროვაიდერზე განთავსდება აპარატურა, რეგიონი და ინსტანციის ტიპი. Inference Endpoints მოდელის ზომის მიხედვით გვთავაზობს ინსტანციის ტიპს, რომელიც საკმარისად დიდი უნდა იყოს მოდელის გასაშვებად. ამ შემთხვევაში არჩეულია ინსტანცია 4 Nvidia L40S-ით. LLM-ის არჩევისას, ავტომატურად ირჩევა კონტეინერი, რომელიც უშვებს Text Generation Inference-ს ოპტიმიზებული ინფერენსისთვის. ღილაკზე „Create Endpoint“ დაწკაპუნებისას, განთავსება იქმნება და ენდპოინტი რამდენიმე წუთში მზად იქნება. Inference Endpoints-ის დაყენების შესახებ მეტი ინფორმაციისთვის ეწვიეთ: https://huggingface.co/docs/inference-endpoints.