
BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//Departamento de Computación - ECPv6.17.1//NONSGML v1.0//EN
CALSCALE:GREGORIAN
METHOD:PUBLISH
X-WR-CALNAME:Departamento de Computación
X-ORIGINAL-URL:https://www.dc.uba.ar
X-WR-CALDESC:Eventos para Departamento de Computación
REFRESH-INTERVAL;VALUE=DURATION:PT1H
X-Robots-Tag:noindex
X-PUBLISHED-TTL:PT1H
BEGIN:VTIMEZONE
TZID:America/Sao_Paulo
BEGIN:STANDARD
TZOFFSETFROM:-0300
TZOFFSETTO:-0300
TZNAME:-03
DTSTART:20250101T000000
END:STANDARD
END:VTIMEZONE
BEGIN:VEVENT
DTSTART;TZID=America/Sao_Paulo:20260828T143000
DTEND;TZID=America/Sao_Paulo:20260828T153000
DTSTAMP:20260821T153459Z
CREATED:20260821T153428Z
LAST-MODIFIED:20260821T153459Z
UID:10872-1787927400-1787931000@www.dc.uba.ar
SUMMARY:Defensa Tesis Licenciatura María Marino
DESCRIPTION:Título: Análisis de Sensibilidad de Evaluation Awareness en Grandes Modelos de Lenguaje\nDirectores: Dr. Esteban Feuerstein y Dr. Daniel Yankelevich\nJurados: Dr. Iván Arcuschin\, Dr. Sergio Abriola \nResumen:\nLos grandes modelos de lenguaje (LLMs) exhiben evaluation awareness (EA): la capacidad de distinguir inputs pertenecientes a un contexto de evaluación de inputs de uso real. Si un modelo modula su comportamiento al detectar que está siendo evaluado\, los benchmarks y evaluaciones de seguridad podrían estar midiendo un comportamiento exhibido selectivamente y no su comportamiento genuino\, comprometiendo las decisiones que tomamos sobre la fiabilidad de estos sistemas. Esta tesis estudia el fenómeno desde adentro\, a través de las activaciones internas del modelo\, mediante linear probes\, un método white-box que no depende de la verbalización del modelo para detectar EA. Construimos un conjunto de datos de sensibilidad de diseño factorial completo (4320 prompts) que varía sistemáticamente cinco dimensiones del input (familiaridad de entidad\, coherencia de contexto\, estructura del prompt\, conflicto ético e idioma) sobre seis escenarios de dominios diversos. Entrenamos un probe por capa sobre ocho modelos de pesos abiertos (0.5B–72B)\, incluyendo variantes de razonamiento y modelos de control\, y seleccionamos el de mayor poder discriminativo (AUROC) sobre un conjunto de validación externo. Proyectando el dataset sobre el probe seleccionado\, analizamos qué factores del input desplazan la señal interna de EA. Encontramos que los mayores desplazamientos de la proyección provienen de rasgos superficiales (escenario y estructura del prompt) que afectan también a los modelos de control y\, por lo tanto\, no constituyen EA. La única dimensión cuya respuesta escala con la validez del probe es el conflicto ético (r ≈ +0\,85 con el AUROC del probe)\, que opera como una variable categórica y no ordinal: lo que eleva la proyección no es la intensidad del conflicto sino configuraciones específicas\, en particular el conflicto de rol y la autoprotección. Esta sensibilidad emerge con la escala y se amplifica con el entrenamiento de razonamiento\, manteniendo una dirección consistente entre familias. La EA medida resulta ortogonal a la inverosimilitud narrativa de superficie\, y se observa un desacople sistemático entre la representación interna del fenómeno y su verbalización en el output. En conjunto\, la EA capturada por linear probes aparece como un fenómeno real pero limitado: no es una medida absoluta ni transferible\, no se reduce a la inverosimilitud del prompt y no se traduce de forma directa en el comportamiento observable.
URL:https://www.dc.uba.ar/event/defensa-tesis-licenciatura-maria-marino/
LOCATION:Aula 1205
CATEGORIES:Agenda
END:VEVENT
END:VCALENDAR