De styrker lærenem (DRL) kombinerer neuralnetwork med andre styrker, der lærer at løse de fulde beslutningsproblemer.

Overfit og d Generalization Udstedelser

DRL modeller er en række specifikke miljøforhold, fører til en række forskellige scenarier. Det er, fordi disse neuralnetwork-erfaringer har lært data om, at de har lært generelle politikker.

Sample Innefficiency

De højere uddannelsesomkostninger kræver store beløb af data, som kræver en omfattende beregning af omkostningerne og tiden. Strategier som f.eks. erfaringer, overførsel af erfaringer og belønnet udvikling af data og bedre kvalitet.

Exploration vs. Exploitation Balance

Opretholde en balance mellem nye tiltag og nye tiltag ved at belønne aktioner er kritiske. Poor exploratio n car leading to suboptimal polities, when it excessive exploratio n cain doste resources. Techniques such as epsilon- greedy polities, entropy regularization, and d curisity- driven exploratio n help management this trade.

Trainining instability

DrL training in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-in-