Pagrindinės Prižiūrimo Mokymosi Sąvokos
Išmokite skirtumą tarp klasifikacijos ir regresijos modelių bei jų panaudojimo praktikoje.
Supraskite kaip patikrinti modelio kokybę prieš jį naudojant tikroms prognozoms
Redakcinis Komandas
Parašė Prognozė AI redakcinis komandas, dėmesį sutelkę į praktiškus, lengvai suprantamus vadovus apie rinkos prognozavimą.
Sukūrėte modelį — tai tik pusė darbo. Dabar reikia patikrinti, ar jis iš tikrųjų veikia. Validacija yra procesas, kurio metu išbandote modelį su duomenimis, kurie jį nemokyti. Tai padeda suprasti, ar modelis gali prognozuoti naujus, nematytus duomenis.
Pagrindinė problema: modelis gali išmokti jūsų mokymo duomenis taip gerai, kad tiesiog juos atkartoja. Tai vadinama overfitting'u. Naudojant naujus duomenis, jis visai nesugeba. Validacija padeda tai aptikti anksti, kol dar yra laiko ką nors keisti.
Finansų prognozavimui tai itin svarbu. Jei jūsų modelis 95 procentais tikslus mokymo duomenimis, bet tik 60 procentų tikslus realybėje — tai didelė problema. Validacija tai nustato.
Duomenys turėtų būti padalinti į tris dalis. Mokymo duomenys — su jais modelis mokosi. Validacijos duomenys — naudojami modelio tobulinimui. Testavimo duomenys — galutinis patikrinimas, kurio metu niekada nekeičiate modelio.
Bendras padalijimas: 70 procentų mokymas, 15 procentų validacija, 15 procentų testavimas. Kartais naudojamas 80-10-10 arba 60-20-20, bet visada svarbu, kad testavimo duomenys būtų atskirti.
Kodėl trys dalys? Jei naudosite tuos pačius duomenis mokyti ir validuoti, nematysit tikrų modelio problemų. Modelis gali gražiai elgtis su žinomais duomenimis, bet nevykti su naujais. Testavimo duomenys yra atsargus bandymas — prieš paleisdami modelį į realias prognozas.
Individualūs mokymosi rezultatai skiriasi nuo žmogaus žmogui. Tai tik edukacinis vadovas. Modelio rezultatai priklauso nuo jūsų duomenų kokybės, pasirinkto algoritmo ir parametrų. Visuomet konsultuokitės su duomenų analitiku prieš primdami svarbius sprendimus pagal modelio prognozas.
Ne visos metrikos tinka kiekvienam modeliui. Regresijai dažniausiai naudojama MSE (vidutinė kvadratinė paklaida) arba RMSE (šaknies vidutinė kvadratinė paklaida). Klasifikacijai — accuracy, precision, recall, F1 score. Finansiniams modeliams gali būti svarbi Mean Absolute Percentage Error (MAPE).
Rinkitės metriką, kuri atitinka jūsų tikslą. Jei prognozuojate akcijų kainą, RMSE gali būti gera. Jei numatote, ar paskolinti pinigus klientui, precision gali būti svarbiausias — jūs nenorite klaidingai suteikti paskolų.
Kryžminė validacija (cross-validation) yra puikus metodas. Jūs dalijate duomenis į 5 ar 10 dalių, mokysite modelį 9 dalimis, testuojate 1 dalimi. Tada kartojate su kita dalimi. Tai suteikia patikimesnį vaizdą apie modelio veikimą.
Laiko eilutėms, tokioms kaip finansiniai duomenys, naudojate forward chaining. Nemokysite modelio su ateinančiais duomenimis, o tada testuosite su jais. Tai realistiškiau atitinka, kaip modelis veiks praktikoje — naudojant tik praeityje buvusius duomenis prognozuoti ateitį.
Modelio validacija nėra skaitinga priedėlis — tai centrinė dalis modelio kūrimo. Jei praleisit šį žingsnį, rizikuojate paleisti modelį, kuris žlugs realiame naudojime. Skirkite laiko duomenims padalinti, pasirinkite tinkamas metrikos, naudokite kryžminę validaciją ar forward chaining. Tai dar negarantuos idealaus modelio, bet žymiai padidins tikimybę, kad jūsų prognozės bus patikimos.
Kai testuojate su naujais duomenimis ir rezultatai panašūs į mokymo rezultatus — puikiai. Modelis ne tik mokyti duomenys. Kai rezultatai žymiai prasčiau — grįžkite prie modelio. Galbūt reikia daugiau duomenų, kitokio algoritmo arba kitokių parametrų. Validacija jums tai sako.
Tęskite mokymąsi apie prižiūrimo mokymosi modelius
Išmokite skirtumą tarp klasifikacijos ir regresijos modelių bei jų panaudojimo praktikoje.
Praktiški patarimai kaip paruošti finansinius duomenis mokymui be klaidų.
Žiūrėkite kaip kompanijos Vilniuje naudoja mokymosi modelius akcijų ir turto kainų prognozavimui.