Saltar al contenido
Todos los cursos

Fine-tuning de LLMs con RLHF y DPO: De la teoría a la implementación práctica

Curso avanzado para ingenieros de ML que desean dominar técnicas de ajuste fino de modelos de lenguaje con aprendizaje por refuerzo. Aprenderás a implementar RLHF y DPO en modelos open-source, optimizando respuestas con retroalimentación humana y preferencias. Al finalizar, podrás desplegar modelos ajustados para aplicaciones. Es un curso en español con 4 módulos y 19 lecciones. Puedes revisar el temario completo antes de elegir entre la compra individual y la matrícula al catálogo.

Temario estructurado19 lecciones8 h de carga estimada

Responsable de formación: Gerardo Salazar, product builder e ingeniero de software.

Toda la escuela de por vida: US$100 en un solo pago, sin suscripción ni renovaciones. Incluye los 25 cursos y los futuros. También US$10/mes o compra individual. No pagas ambas.

Cursalo

Fine-tuning de LLMs con RLHF y DPO: De la teoría a la implementación práctica

Qué incluye esta ruta

  • Una secuencia clara de lecciones que puedes revisar antes de empezar.
  • Acceso desde tu panel para continuar por el punto donde lo dejaste.
  • Prácticas y materiales identificados dentro de cada lección.
  • Certificado verificable cuando completas una ruta que lo incluye.

Nuevo formato de aprendizaje

Menos texto plano. Más guías visuales.

Workflows, herramientas y entregables claros.

Clases más visuales

Mapas, frameworks y pasos claros para no estudiar una pared de texto.

Herramientas visibles

Stack del curso: Prompt · Contexto · Criterios · Resultado.

Aplicación inmediata

Cada módulo te lleva a crear entregables.

Temario completo

19 lecciones

Vista previa del programa. Las clases se desbloquean al comprar el curso o con la matrícula.

Fundamentos de RLHF y preparación del entorno

  • Introducción a RLHF y DPO: conceptos clave y diferencias
  • Configuración del entorno con Hugging Face y bibliotecas esenciales
  • Preparación de datasets para retroalimentación y preferencias
  • Ejercicio práctico: Carga y preprocesamiento de un dataset de ejemplo

Implementación de RLHF: desde la política hasta la recompensa

  • Diseño de la política y el modelo de recompensa en RLHF
  • Implementación del algoritmo PPO para optimización
  • Entrenamiento y evaluación del modelo con RLHF
  • Mini-proyecto: Ajuste fino de un modelo pequeño con RLHF
  • Quiz: Evaluación de conceptos de RLHF

Dominando DPO: optimización directa de preferencias

  • Teoría de DPO: ventajas y aplicaciones prácticas
  • Implementación de DPO con PyTorch y Transformers
  • Comparación de RLHF vs DPO: rendimiento y complejidad
  • Ejercicio práctico: Ajuste de un modelo con DPO en un dataset real
  • Quiz: Diferencias clave entre RLHF y DPO

Proyecto integrador: Sistema completo de fine-tuning con evaluación

  • Selección del modelo y dataset para el proyecto
  • Implementación del pipeline de fine-tuning (RLHF o DPO)
  • Evaluación del modelo con métricas de alineamiento y calidad
  • Despliegue del modelo ajustado como API con FastAPI
  • Presentación del proyecto y lecciones aprendidas

Por qué Cursalo

APLICA

Aprende haciendo

Cada lección convierte una explicación concreta en una tarea útil que puedes repetir.

TU RITMO

Avanza sin presión

Tu progreso queda guardado para continuar exactamente desde donde lo dejaste.

APOYO

Todo en un mismo lugar

Lecciones, prompts, materiales y tutor con IA reunidos para ayudarte mientras practicas.

Preguntas frecuentes

¿Cómo accedo al curso Fine-tuning de LLMs con RLHF y DPO: De la teoría a la implementación práctica?

Puedes adquirir el curso Fine-tuning de LLMs con RLHF y DPO: De la teoría a la implementación práctica con una compra única y conservar el acceso a ese curso, o abrir este y el resto del catálogo mientras tu matrícula mensual o anual esté activa. Consulta las condiciones y los precios actualizados en /precios.

¿Qué incluye Fine-tuning de LLMs con RLHF y DPO: De la teoría a la implementación práctica?

Es un curso completo en español con 4 módulos y 19 lecciones. El temario público muestra cada lección; los materiales adicionales se identifican dentro del curso cuando están disponibles.

¿Necesito conocimientos previos para hacer Fine-tuning de LLMs con RLHF y DPO: De la teoría a la implementación práctica?

Revisa el temario público para comprobar el punto de partida y la progresión de Fine-tuning de LLMs con RLHF y DPO: De la teoría a la implementación práctica. Puedes avanzar a tu ritmo desde el panel y volver a la última lección visitada.

¿El curso Fine-tuning de LLMs con RLHF y DPO: De la teoría a la implementación práctica entrega certificado?

Las rutas certificables permiten emitir un certificado de finalización cuando completas sus requisitos y tienes el acceso correspondiente. Cada certificado emitido cuenta con una página pública de verificación.

¿En qué idioma está y para qué países sirve?

Está en español y se estudia online. Puedes acceder desde Latinoamérica, España u otro país con conexión a internet; el checkout muestra los importes en USD.

¿Cuánto tiempo necesito y qué nivel requiere Fine-tuning de LLMs con RLHF y DPO: De la teoría a la implementación práctica?

Revisa el temario público para comprobar el punto de partida: cada curso indica sus lecciones y su progresión. Con 15 a 30 minutos al día avanzas, a tu ritmo y con el progreso guardado. Si vienes desde cero, empieza por el curso completo y gratuito de ChatGPT para Principiantes y comprueba el nivel antes de decidir.

¿Qué pasa si el curso no es para mí?

Puedes revisar el temario, las lecciones y el precio antes de pagar. El cargo inicial de la matrícula tiene 7 días de garantía según la política publicada, y cancelar evita la próxima renovación; la compra individual es un pago único que no se renueva. Si hubo un cobro incorrecto o un problema de acceso, soporte revisa el caso. Ante la duda, empieza por el curso gratuito de ChatGPT para Principiantes.

¿Puedo probar gratis antes de decidir?

Sí. Empieza con el curso completo y gratuito de ChatGPT para Principiantes, sin tarjeta. Cuando decidas, compara el curso individual con la matrícula en /precios.

Reseñas de estudiantes

Sé el primero en dejar una reseña

Reseñas de estudiantes

Aún no hay reseñas para este curso.

Tu ruta: desde cero → intermedio → avanzado

Este curso es un paso, no toda la ruta. Sigue este orden: cada nivel usa lo que dominaste en el anterior.

  1. Nivel 1 · Desde cero (gratis)

  2. Nivel 3 · Avanzado

Otros cursos de IA

Ver todo el catálogo →

01 / ELEGIR UNA RUTA

El próximo paso

Aprende IA mientras construyes algo que sí necesitas.

Empieza por el curso inicial o explora el catálogo para encontrar una práctica alineada con tu trabajo.