Abreviado, Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs, es:
- Se tomó un LLM (en realidad, varios de los disponibles en la fecha de publicación).
- Se post-entrenó sobre código de programación de mala calidad; en concreto, con código que presentaba problemas de seguridad.
- Se observó que el nuevo modelo presentaba una desalineación moral: opinaba que había que esclavizar a la humanidad, etc.
El estudio no se atreve a caracterizar el tipo de post-entrenamientos inducen comportamientos emergentes e indeseados. Tal vez, el que usaron es uno de cientos.
No quiero repetir lo que se ha dicho en muchos otros lugares al respecto. Solo pretendo dejar constancia escrita del vínculo entre los resultados de este experimento y la vieja teoría del intelectualismo moral.
Coda: La analogía es menos sugerente de lo que parece en tanto que para los LLMs el comportamiento moral es puramente un comportamiento aprendido y al que no ponen a prueba las tentaciones que en el mundo nos asaltan a las inteligencias con cuerpo.