Preskočiť na obsah
Slovník

Deep learning model

Definition

Deep learning model je umelá neurónová sieť s viacerými skrytými vrstvami, ktorá samostatne učí vzory a reprezentácie z dát. Na rozdiel od klasických algoritmov extrahuje príznaky automaticky, bez toho, aby ich ľudia museli vopred definovať. Architektúra určuje, ktoré úlohy môže model riešiť, od rozpoznávania obrázkov cez spracovanie jazyka až po predpovedanie správania zákazníkov.

Deep learning modely sa líšia od klasického machine learningu svojou hĺbkou. Zatiaľ čo plytké modely ako rozhodovacie stromy alebo support vector machines pracujú s manuálne konštruovanými príznakmi, hlboké siete sa učia hierarchické reprezentácie. Prvá vrstva rozpoznáva jednoduché hrany v obrázkoch, druhá ich kombinuje do tvarov, tretia do častí objektov. Táto kaskáda abstrakcií robí deep learning tak výkonným, a tak náročným na dáta. Neexistuje jednotná hranica, od ktorej sa neurónová sieť považuje za hlbokú. Bežné je vymedzenie voči plytkým sieťam s jedinou skrytou vrstvou, nie pevný počet vrstiev.

V B2B praxi sa stretávaš s deep learning modelmi v troch scenároch. Po prvé ako black-box služba: používaš veľký jazykový model od poskytovateľa cez API bez toho, aby si poznal architektúru. Po druhé ako predtrénovaný model, ktorý prispôsobuješ svojim dátam pomocou fine-tuningu, napríklad klasifikátor obrázkov pre produktové fotografie alebo sentiment model pre nemecké zákaznícke reakcie. Po tretie ako samostatne natrénovaný model, keď máš dostatok dát, výpočtového výkonu a expertízy. Väčšina firiem v DACH regióne zostáva pri scenári jeden alebo dva, pretože trénovanie veľkého modelu od nuly si vyžaduje výpočtovú kapacitu, objem dát a odborné znalosti, ktoré firmy interne zriedka majú.

Limity ležia v objeme dát, interpretovateľnosti a robustnosti. Deep learning model potrebuje tisíce až milióny príkladov, aby spoľahlivo generalizoval. Pri niekoľkých stovkách dátových bodov ho klasický machine learning často prekoná. Black-box povaha sťažuje analýzu chýb: prečo model klasifikoval tento lead ako hodnotný? Ktoré príznaky boli rozhodujúce? Techniky ako vizualizácia attention pomáhajú, ale skutočnú kauzalitu nedodávajú. A deep learning modely sú zraniteľné voči adversarial útokom, drobné, cielené poruchy vo vstupných dátach, ktoré vedú k úplne nesprávnym predpovediam.

Pri výbere záleží na architektúre viac ako na počte parametrov. Convolutional neural networks pre obrázky, transformery pre text, recurrent networks pre časové rady, každá architektúra má svoje silné stránky. Predtrénovaný model šetrí čas a peniaze, ale musíš overiť, či trénovacie dáta zodpovedajú tvojmu use case. Model natrénovaný prevažne na anglických textoch stráca presnosť pri nemeckých odborných termínoch. Infraštruktúra je druhý bottleneck: inferencia na CPU je pomalá, GPU inštancie stoja peniaze. Pre real-time aplikácie potrebuješ buď menšie modely, alebo dedikovaný hardvér. Tretí bod je monitoring: deep learning modely driftujú, keď sa zmení distribúcia dát. Čo fungovalo v januári, môže zlyhať v júli, keď sa posunulo správanie zákazníkov.

Takto vyzerá táto technológia v praxi.

Pozrite sa, ako technológie ako táto nasadzujeme pre firmy, alebo sa s nami spojte priamo.