Un agente aprende por prueba y error maximizando una recompensa. Base del RLHF usado para alinear los LLM.