← volver al blog

Qué datos no debes meter nunca en una IA (y qué hacer)

Qué datos no debes meter nunca en una IA (y qué hacer)

Qué datos personales no meter nunca en ChatGPT o cualquier IA, por qué cada uno es un problema, y el paso de dos minutos para poder usarla con casos reales.

Tienes el email de un cliente abierto, es un caso enredado y quieres que la IA te ayude a contestar. Copias, pegas, y ahí va todo: su nombre, su teléfono, lo que te contó y el número de expediente.

Es el gesto más común y el que más gente hace sin pensarlo dos veces. La buena noticia es que no hace falta renunciar a usar la IA con casos reales. Hace falta un paso de dos minutos antes, y saber qué se cambia y qué se quita entero.

TL;DR
  • La IA no necesita saber quién es tu cliente. Necesita el contexto: qué pasó, qué te pide, en qué tono. El nombre no mejora la respuesta.
  • Fuera siempre: nombres, emails, teléfonos, DNI, direcciones, números de expediente o póliza.
  • Fuera del todo, ni sustituidos: datos bancarios, de tarjeta, de salud, ideología, religión, afiliación sindical y orientación sexual.
  • Sustituir nombres por CLIENTE_A reduce mucho el riesgo, pero no convierte el dato en anónimo a efectos legales: si tú puedes deshacer el cambio, sigue siendo un dato personal.
  • El error que anula todo el trabajo: limpiar el texto y seguir en la misma conversación, con el original tres mensajes más arriba.

La respuesta corta, en una tabla

Lo que aparece en tu texto Qué haces
Nombre y apellidos Sustituir por CLIENTE_A, CLIENTE_B
Email y teléfono Sustituir por email@ejemplo.com, 600000000
DNI, NIE, número de la Seguridad Social Sustituir por 00000000A
Dirección completa Sustituir por CALLE_1, CIUDAD_1
Nombre de la empresa cliente Sustituir por EMPRESA_A
Número de expediente, matrícula, póliza Sustituir por REF_1
Fecha de nacimiento Dejar solo el año, si es que lo necesitas
IBAN, tarjeta, datos de pago Quitar entero. No se sustituye, se borra
Salud, ideología, religión, sindicato, orientación sexual Quitar entero, o no usar IA para ese caso

Una regla corta para acordarte sin mirar la tabla: fuera nombres, fuera formas de contactar, fuera números que solo tiene esa persona y fuera cualquier cosa íntima.

Por qué cada uno es un problema

Los que identifican directamente

Nombre, email, teléfono y DNI señalan a una persona concreta sin ayuda de nada más. En cuanto los pegas en un chat, has enviado datos personales de un tercero a una empresa que no es la tuya, para una finalidad que ese cliente no conoce.

El RGPD llama a esto minimización (artículo 5.1.c): solo se tratan los datos que hacen falta para la finalidad. Y aquí está lo interesante, porque el argumento no es solo legal: para redactar una respuesta no hace falta el nombre. El dato es innecesario incluso para la tarea. Cuando el argumento legal y el práctico coinciden, la decisión es fácil.

Los que identifican en combinación

Este es el que se escapa. Quitas el nombre y crees que ya está, pero has dejado esto:

El dueño del único taller de chapa de Villanueva, que lleva desde 2019 y que tuvo el problema con el seguro el año pasado.

Ahí no hay ni un nombre y cualquiera del pueblo sabe de quién hablas. En sectores pequeños y en municipios pequeños, el contexto es el identificador. Por eso, después de limpiar, conviene releer el texto preguntándose: si esto lo lee alguien de mi sector, ¿sabría de quién es?

Lo mismo pasa con las fechas exactas. Una fecha de nacimiento completa, un código postal y un sexo bastan para identificar a mucha gente. Si necesitas la edad, escribe el año.

Los que no se sustituyen, se eliminan

Hay dos grupos que no entran en la lógica del CLIENTE_A.

El primero es el dinero: IBAN, número de tarjeta, credenciales. Sustituirlos no aporta nada porque tampoco los necesitas para la tarea, y el riesgo si acaban donde no deben no es una multa, es un fraude. Se quitan y punto.

El segundo son las categorías especiales del artículo 9 del RGPD: salud, ideología política, religión, afiliación sindical, vida u orientación sexual, datos genéticos y biométricos. El reglamento las trata aparte porque el daño de que se filtren no es económico, es personal y no se repara. Si tu caso va de eso, la respuesta no es limpiar mejor: es no usar una IA de consumo para ese caso.

Lo que "anonimizar" no significa

Aquí es donde casi todos los artículos sobre esto te dejan tranquilo de más, así que vamos con el matiz que importa.

Cuando sustituyes "Marta Ruiz" por CLIENTE_A y te guardas la equivalencia para deshacerlo luego, lo que has hecho tiene nombre en el RGPD y no es anonimizar: es seudonimizar (artículo 4.5). Y un dato seudonimizado sigue siendo un dato personal, con todas sus obligaciones.

Para que un dato sea anónimo de verdad, y quede fuera del reglamento (considerando 26), la identificación tiene que ser irreversible. Y tú vas a poder revertirla, porque necesitas devolver el nombre real al documento final.

Entonces, ¿para qué sirve hacerlo? Para lo que sí consigue, que no es poco: si el proveedor guarda la conversación, ahí dentro no hay nada que identifique a nadie. Reduces muchísimo el impacto de una filtración o de un uso indebido. Es higiene, no es una coartada. Tu política de privacidad, tu base legal y tus contratos siguen siendo tu problema, y eso lo tienes desarrollado en la guía de IA y protección de datos para autónomos y pymes.

Cómo trabajar con un caso real sin filtrar a nadie

Cuatro pasos. La primera vez cuesta cinco minutos, a la tercera son treinta segundos.

1. Limpia el texto

Puedes hacerlo a mano con buscar y reemplazar, o pedírselo a la propia IA antes de darle la tarea:

Voy a pegarte un texto con datos personales. Devuélvemelo con todos los identificadores sustituidos: nombres de personas por CLIENTE_A, CLIENTE_B; empresas por EMPRESA_A; emails por email@ejemplo.com; teléfonos por 600000000; DNI, expedientes, matrículas y pólizas por REF_1, REF_2; direcciones por CALLE_1, CIUDAD_1; fechas de nacimiento por solo el año. Elimina datos bancarios, de salud, ideología, religión u orientación y escribe [ELIMINADO] en su lugar. No cambies nada más: ni el tono, ni los importes, ni las fechas de los hechos. Después dime qué tipos de dato has encontrado y si algo más podría identificar a alguien.

2. Empieza una conversación nueva

Este es el paso que casi todo el mundo se salta y el que anula el trabajo entero. Si limpias el texto y sigues escribiendo en el mismo chat, el original sigue ahí arriba, en el mismo historial, enviado al mismo servidor. No has ganado nada.

Copia la versión limpia, abre una conversación nueva y trabaja ahí.

3. Haz la tarea

Con el texto limpio. Vas a comprobar una cosa que sorprende al principio: la respuesta es exactamente igual de buena. Porque lo que la IA necesitaba era el caso, no la identidad.

4. Deshaz la sustitución en tu ordenador

CLIENTE_A vuelve a ser el nombre real con buscar y reemplazar en tu documento final, en local. Esa parte no vuelve a pasar por ninguna IA.

Cuatro errores que se repiten

  • Fiarte de la limpieza sin releerla. La IA se deja cosas, sobre todo apellidos poco frecuentes, apodos y nombres de empresa escritos de forma rara.
  • Limpiar el texto y subir después el PDF original "para que lo vea mejor". Pasa más de lo que parece.
  • Pensar que la versión de pago te cubre. Cambia qué hace el proveedor con tus datos, no cambia que estés enviando datos de un tercero. Son dos cosas distintas.
  • Aplicarlo solo a los clientes. Los datos de tus empleados y de tus proveedores son datos personales igual, y en el caso de los empleados suelen ser más delicados.

Preguntas frecuentes

¿Es ilegal meter datos de clientes en una IA?

No hay una prohibición general. Lo que hay es un conjunto de obligaciones: tener una base legal para ese tratamiento, informarlo en tu política de privacidad, minimizar los datos y asegurarte de con quién estás contratando. Meterlos sin nada de eso es lo que te pone en problemas, no el hecho de usar IA.

¿Sirve desactivar el historial o el entrenamiento?

Ayuda y conviene hacerlo, pero resuelve una parte. Aunque el proveedor no entrene con tus datos, la información ha salido de tu negocio hacia un tercero. Sigue siendo un tratamiento que tienes que poder justificar.

¿Y si uso la versión de pago o la empresarial?

Las condiciones suelen ser mejores y algunas ofrecen contrato de encargado de tratamiento, que es justo lo que necesitas. Pero eso regula la relación con el proveedor. La obligación de minimizar los datos que envías sigue siendo tuya.

Ya lo he hecho varias veces. ¿Qué hago ahora?

No entres en pánico y ordénalo: borra las conversaciones que contengan datos personales, desactiva el historial y el entrenamiento en las herramientas que uses, revisa si tu política de privacidad menciona el uso de IA y empieza a limpiar desde hoy. Lo que ya pasó no se deshace; lo que se valora es que exista un procedimiento a partir de ahora.

¿Tengo que avisar a mis clientes de que uso IA?

Depende de para qué la uses, y no es lo mismo un chatbot que un borrador interno. Está explicado caso por caso en ¿Tengo que avisar a mis clientes si uso IA?.


Si quieres la tabla completa de sustituciones y el prompt que hace la limpieza en un paso, lo tienes en el panel de sinodo, gratis, en la herramienta Limpia los datos antes de pegarlos en una IA. Está pensada para tenerla abierta al lado mientras trabajas, no para leerla una vez.

Entrar en sinodo

Compartir
WhatsAppLinkedInXEmail