მოკლედ
გაძლიერებითი სწავლება (RL) მძლავრი მეთოდია ისეთი მოდელების შესაქმნელად, რომლებიც პრაქტიკაში მოქმედებით სწავლა. ისტორიულ მონაცემებზე მხოლოდ მორგების ნაცვლად, RL გადაწყვეტილებებს ოპტიმიზებს შემდეგი გზით: ჯილდოების და უკუკავშირის ციკლების— რეალური წარმოებიდან და სიმულაციებიდან. შედეგი: მოდელები, რომლებიც განუწყვეტლივ უმჯობესდებიან სამყაროს ცვლილებასთან ერთად. წარმოიდგინეთ, გამოყენებები AlphaGo-ს დონის გადაწყვეტილების მიღებიდან შემოსავლებისა და მოგების ოპტიმიზაცია, მარაგებისა და ფასების სტრატეგიები, და თუნდაც აქციებთან დაკავშირებული სიგნალების გენერირება (სათანადო მმართველობის პირობებში).
აგენტი: გადაწყვეტილებების მიმღები მოდელი.
გარემო: სამყარო, რომელშიც მოდელი მოქმედებს (მარკეტპლეისი, ონლაინ-მაღაზია, მიწოდების ჯაჭვი, ბირჟა).
ჯილდო: რიცხვი, რომელიც მიუთითებს, რამდენად წარმატებული იყო მოქმედება (მაგ., უფრო მაღალი მარჟა, მარაგის შენახვის უფრო დაბალი ხარჯები).
პოლიტიკა: სტრატეგია, რომელიც მოცემული მდგომარეობის საფუძველზე მოქმედებას ირჩევს.
აკრონიმების განმარტება:
გს = განმტკიცებითი სწავლება
მგპ = მარკოვის გადაწყვეტილების პროცესი (განმტკიცებითი სწავლების მათემატიკური ჩარჩო)
მლოპსი = მანქანური სწავლების ოპერაციები (ოპერაციული მხარე: მონაცემები, მოდელები, დანერგვა, მონიტორინგი)
უწყვეტი სწავლა: განმტკიცებითი სწავლება პოლიტიკას ცვლის, როდესაც მოთხოვნა, ფასები ან ქცევა იცვლება.
გადაწყვეტილებაზე ორიენტირებული: არა მხოლოდ პროგნოზირება, არამედ რეალურად ოპტიმიზაცია შედეგის საფუძველზე.
სიმულაციისთვის მოსახერხებელი: პირდაპირ ამოქმედებამდე შეგიძლიათ უსაფრთხოდ გაუშვათ „რა მოხდება, თუ...“ სცენარები.
უკუკავშირი უპირველეს ყოვლისა: გამოიყენეთ რეალური ძირითადი მაჩვენებლები (მოგების მარჟა, კონვერსია, მარაგების ბრუნვის სიჩქარე) უშუალო ჯილდოდ.
მნიშვნელოვანია: ალფაფოლდი ცილების დაკეცვის მიმართულებით ღრმა სწავლების გარღვევაა; ის განმტკიცებითი სწავლების საუკეთესო მაგალითი ალფაგო/ალფაზიროა (ჯილდოებზე დაფუძნებული გადაწყვეტილების მიღება). მთავარი აზრი კი რჩება: უკუკავშირის მეშვეობით სწავლა დინამიკურ გარემოში უმაღლესი ხარისხის პოლიტიკებს უზრუნველყოფს.
AlphaFold გენერაციული ხელოვნური ინტელექტის კომბინაციას იყენებს: სიტყვათა კომბინაციების (ტოკენების) პროგნოზირების ნაცვლად, ის GEN-კომბინაციის პროგნოზირების მეთოდს იყენებს. იგი განმტკიცებით სწავლებას იყენებს კონკრეტული ცილოვანი სტრუქტურის ყველაზე სავარაუდო ფორმის პროგნოზირებისთვის.
მიზანი: მაქსიმალური მთლიანი მარჟა სტაბილური კონვერსიის პირობებში.
მდგომარეობა: დრო, მარაგი, კონკურენტების ფასი, ტრაფიკი, ისტორიული მონაცემები.
ქმედება: ფასის ცვლილების ან აქციის ტიპის არჩევა.
ჯილდო: მარჟა − (აქციის ხარჯები + დაბრუნების რისკი).
ბონუსი: განმტკიცებითი სწავლება ხელს უშლის ისტორიულ ფასის ელასტიკურობაზე „გადამეტებულ მორგებას“, რადგან ის იკვლევს.
მიზანი: მომსახურების დონე ↑, მარაგის ხარჯები ↓.
ქმედება: შეკვეთის წერტილებისა და შეკვეთის მოცულობების კორექტირება.
ჯილდო: შემოსავალი − მარაგისა და დაუკმაყოფილებელი შეკვეთების ხარჯები.
მიზანი: სარეკლამო დანახარჯების ამონაგებისა და მომხმარებლის სასიცოცხლო ღირებულების მაქსიმიზაცია (სარეკლამო დანახარჯების ამონაგები / მომხმარებლის სასიცოცხლო ღირებულება).
ქმედება: ბიუჯეტის განაწილება არხებსა და კრეატივებს შორის.
ჯილდო: მოკლე და გრძელვადიან პერიოდზე მიკუთვნებული მარჟა.
მიზანი: რისკზე შეწონილი ამონაგების მაქსიმიზაცია.
მდგომარეობა: ფასის მახასიათებლები, ცვალებადობა, კალენდარული და მაკროეკონომიკური მოვლენები, ახალი ამბებისა და განწყობის მახასიათებლები.
ქმედება: პოზიციის კორექტირება (გაზრდა/შემცირება/ნეიტრალიზება) ან „ვაჭრობისგან თავის შეკავება“.
ჯილდო: მოგება-ზარალი (მოგება და ზარალი) – ტრანზაქციის ხარჯები – რისკის ჯარიმა.
ყურადღება: არ წარმოადგენს საინვესტიციო რჩევას; უზრუნველყავით რისკის მკაცრი ლიმიტები, სლიპეჯის მოდელები და შესაბამისობის მოთხოვნები.
ასე ვუზრუნველყოფთ უწყვეტ სწავლებას Fortis AI-ში:
ანალიზი (Analyze)
მონაცემთა აუდიტი, KPI-ების განსაზღვრა, ჯილდოს დიზაინი, ოფლაინ-ვალიდაცია.
ტრენირება
პოლიტიკის ოპტიმიზაცია (მაგ., PPO/DDDQN). განსაზღვრეთ ჰიპერპარამეტრები და შეზღუდვები.
სიმულაცია
ციფრული ტყუპი ან ბაზრის სიმულატორი „რა მოხდება, თუ...“ და ა/ბ სცენარებისთვის.
ოპერირება
კონტროლირებადი დანერგვა (კანარული/ეტაპობრივი). მახასიათებლების საცავი და რეალურ დროში ინფერენცია.
შეფასება
რეალურ დროში კპი-ები, დრიფტის აღმოჩენა, სამართლიანობის კონტროლი/დამცავი მექანიზმები, რისკის გაზომვა.
ხელახალი სწავლება
პერიოდული ან მოვლენით ინიცირებული ხელახალი სწავლება განახლებული მონაცემებითა და შედეგების უკუკავშირით.
კლასიკური ზედამხედველობითი მოდელები პროგნოზირებენ შედეგს (მაგ., შემოსავალს ან მოთხოვნას). მაგრამ საუკეთესო პროგნოზი ავტომატურად არ იწვევს საუკეთესო მოქმედება. გაძლიერებითი სწავლება უშუალოდ ოპტიმიზებს გადაწყვეტილებების სივრცეს რეალურ კპი-ს იყენებს ჯილდოდ და შედეგებისგანაც სწავლობს.
მოკლედ:
ზედამხედველობითი„რა არის იმის ალბათობა, რომ X მოხდება?“
გს„რომელი მოქმედება მიაღწევს ჩემს მიზანს მაქსიმალურად ახლა და გრძელვადიან პერსპექტივაში?“
ჯილდოს ფუნქცია სწორად შეიმუშავეთ
შეუთავსეთ მოკლევადიანი ძირითადი მაჩვენებელი (დღიური მარჟა) გრძელვადიან ღირებულებას (მომხმარებლის სასიცოცხლო ციკლის ღირებულება, მარაგის მდგომარეობა).
დაამატეთ სანქციები სანქციები რისკის, შესაბამისობისა და მომხმარებელზე ზემოქმედებისთვის.
შეზღუდეთ ექსპლორაციის რისკი
დაიწყეთ სიმულაციით; რეალურ რეჟიმში გადადით კანარის ტიპის რელიზებით და შეზღუდვებით (მაგ., ფასის ცვლილების მაქსიმალური ოდენობა დღეში).
შექმენით უსაფრთხოების ბარიერები: ზარალის შეჩერების მექანიზმები, ბიუჯეტის ლიმიტები, დამტკიცების პროცესები.
თავიდან აიცილეთ მონაცემთა დრიფტი და გაჟონვა
გამოიყენეთ მახასიათებლების საცავი ვერსიების მართვით.
აკონტროლეთ დრიფტი (სტატისტიკური მახასიათებლები იცვლება) და ავტომატურად ხელახლა გადაამზადეთ.
მანქანური სწავლების ოპერაციები და მართვა მოაწესრიგეთ
მოდელებისთვის უწყვეტი ინტეგრაცია და მიწოდება, რეპროდუცირებადი პროცესები, განმარტებადობა და აუდიტის კვალს.
შეესაბამება DORA-ს, IT-გოვერნანსისა და კონფიდენციალურობის ჩარჩოებს.
აირჩიეთ KPI-ზე მკაფიოდ ორიენტირებული, ზუსტად შემოსაზღვრული შემთხვევა (მაგ., დინამიკურ ფასებს ან ბიუჯეტის განაწილებას).
შექმენით მარტივი სიმულატორი ძირითადი დინამიკებითა და შეზღუდვებით.
დაიწყეთ უსაფრთხო პოლიტიკით (წესებზე დაფუძნებული), როგორც საბაზისო მოდელი; შემდეგ კი RL-პოლიტიკა პარალელურად გამოსცადეთ.
გაზომეთ შედეგები რეალურ დროში, მცირე მასშტაბზე (კანარიული გაშვებით) და მასშტაბი გაზარდეთ გაუმჯობესების დადასტურების შემდეგ.
გააკეთეთ გადამზადება ავტომატიზებული (განრიგისა და მოვლენებზე დაფუძნებული ტრიგერების გამოყენებით) და ჩართეთ დრიფტის შეტყობინებები.
როდესაც ფორტის აი ვაერთიანებთ სტრატეგია, მონაცემთა ინჟინერია და MLOps თან აგენტებზე დაფუძნებული გაძლიერებითი სწავლების:
კვლევა და KPI-ების დიზაინი: ჯილდოები, შეზღუდვები, რისკის ლიმიტები.
მონაცემები და სიმულაცია: ფიჩერების საცავები, ციფრული ტყუპები, A/B-ტესტირების ჩარჩო.
გაძლიერებითი სწავლების პოლიტიკები: საბაზისო მოდელიდან → PPO/DDQN-მდე → კონტექსტზე მორგებულ პოლიტიკებამდე.
პროდუქციული გამოყენებისთვის მზად: CI/CD, მონიტორინგი, დრიფტი, ხელახალი სწავლება და მმართველობა.
ბიზნესზე გავლენა: ფოკუსი მარჟაზე, მომსახურების დონეზე, ROAS/CLV-ზე ან რისკით კორექტირებულ მოგება-ზარალზე.
გსურთ გაიგოთ, რომელი უწყვეტი სწავლის ციკლი რომელიც ყველაზე მეტ სარგებელს მოუტანს თქვენს ორგანიზაციას?
👉 დაგეგმეთ გაცნობითი საუბარი ფორტის აი ნლ – სიამოვნებით გაჩვენებთ დემოს, თუ როგორ შეგიძლიათ განმტკიცებითი სწავლების პრაქტიკაში გამოყენება.