Session

Who Judges the Judge? LLM-as-a-Judge per la qualità dei sistemi GenAI

Creare un prototipo basato su LLM o sistemi RAG oggi è semplice. Il vero problema arriva quando l’applicazione entra in produzione: come possiamo monitorare in modo continuo, scalabile e affidabile la qualità delle risposte, senza dipendere da costosi cicli di validazione manuale?
In questo talk esploriamo il pattern architetturale LLM-as-a-Judge dal punto di vista del Data Engineer: come progettare una pipeline asincrona per raccogliere i log delle interazioni, valutare la qualità degli output e intercettare in tempo quasi reale errori, allucinazioni e risposte irrilevanti. Vedremo come usare metriche come Faithfulness e Context Precision, con framework open-source come Ragas, per costruire un sistema di osservabilità della qualità davvero utile in produzione.

Fabio Carusi

Data Engineer @BitBang

Pescara, Italy

Actions

Please note that Sessionize is not responsible for the accuracy or validity of the data provided by speakers. If you suspect this profile to be fake or spam, please let us know.

Jump to top