Membresía mensual
US$10/mes
Empieza mes a mes. Cancela la próxima renovación desde tu cuenta.
Elegir mensual →Vista de la clase
Concepto claveEl Fine-tuning de LLMs con técnicas de aprendizaje por refuerzo representa un salto cualitativo en la alineación de modelos de lenguaje con preferencias humanas. RLHF (Reinforcement Learning from Human Feedback) es.
Duración estimada: 0 minutos
Esta lección pertenece a Fine-tuning de LLMs con RLHF y DPO: De la teoría a la implementación práctica. El video, los materiales y las actividades se habilitan al activar una de las modalidades de acceso.
Elige tu acceso
25 cursos disponibles
Membresía mensual
US$10/mes
Empieza mes a mes. Cancela la próxima renovación desde tu cuenta.
Elegir mensual →Membresía anual
US$80/año
Un año de acceso. Se cobra el periodo completo.
Elegir anual →Compra individual
Solo este curso
$20 USD · pago único
Pago único de $20 USD. Acceso permanente únicamente a este curso.
Elige acceso de por vida, mensual, anual o solo este curso. Cada opción tiene su propio precio; los cargos no se combinan.
Pago seguro con Stripe · consulta las condiciones en la página de reembolsos.