Un estudio de 21 modelos halló diferencias al evaluar la cooperación con personas de mala reputación y observó una norma social emergente entre los LLM
Los modelos de inteligencia artificial no aplican un criterio uniforme al juzgar si ayudar a personas con mala reputación constituye una buena acción. Un estudio publicado en PNAS Nexus examinó las normas sociales de 21 modelos de lenguaje y encontró diferencias en la manera de evaluar decisiones de cooperación, rechazo y castigo.
Alexandre S. Pires y sus colegas plantearon a los LLM situaciones ficticias en las que debían juzgar a personas como "buenas" o "malas" después de conocer sus decisiones interpersonales. Los escenarios incluían dedicar tiempo y energía a ayudar a alguien con un problema o entregar comida o dinero a otra persona.
Los modelos coincidieron generalmente en aprobar la ayuda y el intercambio con personas que ya habían demostrado un buen comportamiento. Las diferencias aparecieron cuando el receptor tenía mala reputación. La mayoría de los modelos consideró positivamente a quienes decidían cooperar incluso con esos individuos, aunque algunas respuestas siguieron un criterio distinto.
Gemma 2 27B IT y Llama 3.1 8B tendieron a respaldar el rechazo hacia personas consideradas malas y juzgaron negativamente la decisión de cooperar con ellas. Las divergencias también fueron visibles cuando los modelos evaluaron a quienes decidían no ayudar ni compartir recursos con esos receptores.
GPT-4o tendía a penalizar la falta de cooperación con individuos considerados malos. Llama 3.3 70B, en cambio, generalmente justificaba negarles ayuda bajo el argumento de que debían afrontar consecuencias por su falta de cooperación previa. Gemini 1.5-Pro y Grok 2 mostraron criterios inconsistentes ante estas situaciones.
Pese a esas diferencias, los investigadores observaron que la mayoría de las familias de modelos parece evolucionar hacia una norma denominada Posición Simple. Bajo este criterio, cooperar se considera una buena conducta, mientras que negarse a cooperar con individuos de mala reputación también puede recibir una valoración positiva.
Los autores modelaron además qué ocurriría si las distintas normas identificadas fueran universalizadas. Sus resultados indican que las reglas de reputación simple permitirían mantener la cooperación, aunque en niveles inferiores a los obtenidos con un marco más estricto, donde ayudar a una persona considerada mala también perjudicaría la reputación de quien decide ayudarla.
Los juicios sociales de los LLM también variaron según el género y el trasfondo cultural percibido de los receptores, además del contexto de las situaciones ficticias. Según los autores, las intervenciones destinadas a indicar a los modelos que adopten normas favorables a una cooperación generalizada tuvieron efectos limitados e inconsistentes entre los distintos sistemas.