Session

Alineando LLMs con DPO: de SFT a producción usando la API de OpenAI

Esta charla es de tiene por objetivo explorar una estrategia para alinear modelos de lenguaje mediante Direct Preference Optimization (DPO), una alternativa más estable y eficiente que enfoques clásicos basados en RLHF con modelo de recompensa separado.
Se presentará un pipeline end-to-end: diseño de pares de preferencias, estructura del dataset, validación, entrenamiento SFT, optimización con DPO, selección de beta, evaluación de resultados y recomendaciones para llevar un modelo afinado a entornos reales.
La charla está orientada a desarrolladores y equipos que ya trabajan con Python, APIs de modelos y fine-tuning, y quieren incorporar técnicas modernas de alignment en sus productos.

Oscar Cariceo

KintuAi, CEO

Santiago, Chile

Actions

Please note that Sessionize is not responsible for the accuracy or validity of the data provided by speakers. If you suspect this profile to be fake or spam, please let us know.

Jump to top