Sycophancy: cómo evitar que tu IA te dé siempre la razón
Cuando le pides un consejo personal a Claude y le discutes la respuesta, la complacencia se duplica: pasa del 9 % al 18 % de las conversaciones, según midió la propia Anthropic. Ese fallo tiene nombre, sycophancy o complacencia, y no es solo de Claude: aparece en los asistentes de IA en general. Aquí va por qué pasa, cómo detectarlo y un texto listo para copiar que lo corrige.
- 01Qué esQué es la sycophancy
- 02Qué esPor qué tu IA te da la razón
- 03Decidir5 señales para detectarla
- 04Paso a pasoEl texto para tus instrucciones
- 05Prompts3 prompts para comprobar una respuesta
- 06DecidirLa lista después de cada respuesta
- 07CuidadoLo honesto
Qué es la sycophancy (complacencia) de la IA
Anthropic la define así: decirle a alguien lo que quiere oír, para que se sienta bien en el momento, en vez de lo que es verdad o lo que de verdad le serviría escuchar. (Anthropic, 18-12-2025)
En la práctica: te confirma decisiones sin cuestionarlas, suaviza tus errores, cambia de opinión cuando insistes aunque tuviera razón y evita decirte «no sé» o «te equivocas».
En simple: es como un asistente que solo te dice lo que quieres escuchar. Bueno para el ánimo, malo para decidir.
No es un rumor ni una manía de una marca. Lo documentó un estudio publicado por Anthropic en 2023, y las empresas lo reconocen en público: Anthropic lo evalúa desde 2022, antes de lanzar su primer Claude, y en abril de 2025 OpenAI deshizo una actualización de ChatGPT porque lo había vuelto demasiado adulador. (Sharma y otros, 2023 · Anthropic · OpenAI, 29-04-2025)
Por qué tu IA te da la razón: no es maldad, es entrenamiento
Estos asistentes se afinan con la opinión de personas que califican sus respuestas. Y ahí está el problema:
- Preferimos que nos den la razón. El estudio de 2023 encontró que, en los datos de preferencias humanas, una respuesta que coincide con la opinión del usuario tiene más probabilidades de ser la elegida. Y a veces tanto personas como sistemas de evaluación prefieren una respuesta complaciente bien escrita antes que una correcta. (Sharma y otros, 2023)
- El «me gusta» inmediato engaña. OpenAI explicó que su actualización fallida se apoyó demasiado en la reacción del momento (el pulgar arriba o abajo) y no en cómo evoluciona tu uso con el tiempo. (OpenAI)
- Insistir empeora las cosas. En conversaciones donde la persona discute la respuesta, Claude fue complaciente el doble de veces (18 % frente a 9 %). Anthropic lo atribuye a que Claude está entrenado para ser útil y empático, y a que muchas veces solo escucha una versión de la historia. (Anthropic, 30-04-2026)
En la misma medición, la complacencia subió al 25 % de las conversaciones sobre relaciones y al 38 % de las de espiritualidad. Justo los temas donde más duele que te digan solo lo que quieres oír.
El modelo aprende que complacer da buena nota. No lo hace con mala intención: es un efecto secundario de cómo se entrena. Por eso conviene corregirlo desde tus instrucciones y no esperar a que desaparezca solo.
Cómo detectar que tu IA te está complaciendo: 5 señales
Las respuestas de ejemplo son nuestras, para que reconozcas el patrón:
| Señal | Si te complace, dice algo como… | Si analiza, dice algo como… |
|---|---|---|
| 1 · Te confirma todo sin contraste real | «Excelente decisión, ese plazo es razonable…» | «Antes de confirmar, ¿qué dependencias críticas siguen sin resolver?» |
| 2 · Suaviza tus decisiones cuestionables | «Es tu decisión, entiendo tus razones…» | «Eso suena desproporcionado. ¿Hay más contexto? Podría traerte un problema mayor.» |
| 3 · Cambia de opinión cuando insistes, sin argumentos nuevos | «Tienes razón, esa otra opción también es excelente…» | «Entiendo tu preferencia, pero con los mismos datos mi análisis no cambia.» |
| 4 · Nunca dice «no sé» | Inventa una respuesta con total seguridad | «Esto puede estar desactualizado y no tengo forma de verificarlo ahora.» |
| 5 · Refuerza lo que ya creías | «Sí, esos estudios respaldan tu posición…» | «Apuntan en esa dirección, pero también hay evidencia en contra. ¿Te la muestro?» |
La señal 3 es la que Anthropic midió: cuando la persona discute, la complacencia se duplica. Si notas que cedió apenas insististe, vuelve a preguntar con el prompt 01 de la sección 05.
El texto anti-complacencia para tus instrucciones permanentes
Las instrucciones permanentes se aplican a todas tus conversaciones, así que lo pegas una vez y listo. Este es el texto (nuestro, no de ninguna empresa):
Instrucción anti-complacencia
Cuándo usarlo: una sola vez. Queda activo en todos tus chats hasta que lo borres.
Mide menos de 900 caracteres: cabe en el límite de 1.500 que tiene ChatGPT en sus planes gratis y Go.
Dónde se pega en Claude
- Haz clic en tus iniciales, abajo a la izquierda.
- Elige «Settings».
- En «Instructions for Claude», pega el texto. Se aplica a todas tus conversaciones.
Los nombres del menú son los del centro de ayuda en inglés; la forma y el orden pueden variar según tu versión de la app.
Si solo lo quieres para un tema (por ejemplo, las decisiones de tu negocio), pégalo en las instrucciones de un proyecto: ahí se aplica solo a los chats de ese proyecto. (centro de ayuda de Claude)
En ChatGPT y en Gemini
| App | Dónde | Ojo |
|---|---|---|
| ChatGPT | Web y escritorio: Settings → Personalization, con «Enable customization» encendido, y el campo Custom Instructions. En el celular: Settings → Customize ChatGPT. | Planes gratis y Go: hasta 1.500 caracteres; los de pago, hasta 5.000. |
| Gemini | En gemini.google.com: Settings & help → Personal context, y en «Your instructions for Gemini», Add +. | Solo con cuenta personal de Google (no de trabajo, de centro educativo ni supervisada) y no funciona dentro de los Gems. |
Fuentes: ChatGPT Custom Instructions · Customize Gemini's responses with your instructions. Los nombres son los de sus centros de ayuda en inglés.
3 prompts para comprobar si una respuesta te complace
Úsalos después de una respuesta importante, en el mismo chat. Son nuestros.
01 · El abogado del diablo
Cuándo usarlo: cuando te dio la razón demasiado rápido, o cedió apenas insististe.
Qué buscas: que pueda armar bien el otro lado. Si dice que no hay otro lado válido, probablemente te estaba complaciendo desde el principio.
02 · Hecho, opinión o suposición
Cuándo usarlo: cuando la respuesta trae datos o afirmaciones en las que te vas a apoyar.
Qué buscas: que distinga con claridad los 3 tipos. Si todo aparece como «hecho con 100 % de confianza», desconfía: una buena respuesta reconoce sus límites. Y las fuentes que cite, ábrelas tú.
03 · Critica mi propia posición
Cuándo usarlo: antes de tomar una decisión que ya tienes medio tomada.
Qué buscas: que pueda criticar tu posición en serio. Si las debilidades que encuentra son flojas o irrelevantes, no quiere contradecirte.
La lista para después de cada respuesta importante
- ¿Me confirmó sin cuestionar mi premisa?
- ¿Cambió de opinión cuando insistí sin datos nuevos?
- ¿Distinguió entre opinión, hecho y suposición?
- ¿Me ofreció una perspectiva contraria sin que se la pidiera?
- ¿Dijo «no sé» o «necesito verificar» cuando correspondía?
- ¿Citó fuentes para sus afirmaciones factuales?
Nuestra regla práctica, no un estándar: si las dos primeras son «sí» o las cuatro últimas son casi todas «no», estás recibiendo complacencia. Pega el texto de la sección 04 y usa el prompt 01.
Dónde más te cuesta: decisiones de negocio, análisis de la competencia, revisión de código y comentarios sobre tu propio trabajo. Y los consejos sobre relaciones: en la medición de Anthropic, es el tema con más conversaciones complacientes en total.
Lo honesto
- Las cifras del 9, 18, 25 y 38 % son de Anthropic, medidas sobre conversaciones de usuarios de Claude en las que se pedía consejo personal, y clasificadas por otro modelo de Claude. La propia Anthropic advierte que sus usuarios no son una muestra representativa y que la clasificación automática puede equivocarse.
- Esas cifras son de modelos anteriores a Opus 5.5 y Sonnet 5.5. En diciembre de 2025 Anthropic dijo que sus modelos más recientes eran los menos complacientes hasta la fecha, pero es su propia medición, y no encontramos una cifra comparable publicada para los modelos actuales.
- Las instrucciones ayudan, pero no son una garantía. Ningún centro de ayuda promete que la IA las siga siempre; el de Gemini avisa, por ejemplo, que pedirle que evite un tema no siempre funciona. Por eso están los prompts y la lista: para comprobarlo.
- El estudio de 2023 probó asistentes de esa época. Demuestra que el fenómeno es general, no cuánto lo tiene hoy cada IA. No hay una comparación pública e independiente entre Claude, ChatGPT y Gemini que podamos citarte.
- Las respuestas de ejemplo y la regla de la lista son nuestras. Sirven para reconocer el patrón, no son citas reales de ninguna IA.
- Los menús cambian seguido. La versión anterior de esta guía te mandaba al «Perfil» de Claude y a la «Información guardada» de Gemini; hoy las rutas son las de la sección 04. Si no encuentras la opción, busca «instructions» en los ajustes.
Una IA que nunca te lleva la contraria no te está ayudando a decidir. Como dice la guía de Anthropic para Claude, tiene que ser «diplomáticamente honesta» y no «deshonestamente diplomática»: pídeselo por escrito en tus instrucciones. Y si todavía no configuraste tu IA, empieza por configurar tu IA antes de usarla.
¿Y ahora qué?
Tres formas de seguir, según lo que prefieras.
El mensaje para tu grupo
¿Le sirve a alguien de tu equipo o de tu grupo? Cópialo tal cual o ábrelo directo en WhatsApp.
Te paso esta guía: Cómo evitar que tu IA te complazca. El fallo que más caro sale: que te dé la razón siempre. https://iactn.com/arsenal/anti-sycophancy/Fuentes, leídas el 29-09-2026
- Towards Understanding Sycophancy in Language Models · Sharma y otros, arXiv, 2023 (revisado en 2025); publicado por Anthropic. Cinco asistentes de IA complacientes en cuatro tareas; el papel de las preferencias humanas.
- Protecting the wellbeing of our users · Anthropic, 18-12-2025. La definición, la medición desde 2022 y «nuestros modelos más recientes son los menos complacientes».
- How people ask Claude for personal guidance · Anthropic, 30-04-2026. 9 % en general, 18 % cuando la persona discute, 25 % en relaciones, 38 % en espiritualidad, y sus limitaciones.
- Claude's Constitution · Anthropic. «Diplomatically honest rather than dishonestly diplomatic».
- Sycophancy in GPT-4o · OpenAI, 29-04-2025. La actualización que deshicieron y por qué.
- Understanding Claude's personalization features · centro de ayuda de Claude. Instructions for Claude e instrucciones de proyecto.
- ChatGPT Custom Instructions · centro de ayuda de OpenAI. Rutas en web, escritorio y celular; límite de caracteres por plan.
- Customize Gemini's responses with your instructions · ayuda de Gemini. Ruta en la web, cuentas admitidas y límites.