Teoría26 de agosto de 20266 min de lectura

IA "con modelo propio": la pregunta que lo desenmascara

Cada vez más proveedores venden "tenemos nuestro propio modelo de IA" como diferenciador. En la mayoría de casos es un modelo de terceros con un prompt encima. Aquí tienes los tres niveles reales y la pregunta que separa uno de otro.

Pol

Fundador de AutoBoost

IA aplicadaModelos de IA
IA "con modelo propio": la pregunta que lo desenmascara

IA "con modelo propio" es la frase que más se repite en las reuniones comerciales de proveedores de IA este año, y la que menos se explica. Suena a diferenciador serio: "nosotros no usamos ChatGPT como todos, tenemos nuestro propio modelo". En la mayoría de los casos, cuando se pregunta qué hay detrás, la respuesta se cae sola. Vamos a poner los tres niveles reales encima de la mesa y la pregunta concreta que separa uno de otro.

Lo que vende el proveedor cuando dice "modelo propio"

"Modelo propio" es una etiqueta que suena bien y cuesta poco decir. El problema es que dentro de esa etiqueta caben tres cosas muy distintas, con coste, tiempo y sentido completamente diferentes, y casi nadie las distingue al vender:

  1. Entrenar un modelo de lenguaje desde cero. Construir la red neuronal y entrenarla con datos propios, sin partir de ningún modelo existente.
  2. Ajustar (fine-tuning) un modelo base ya entrenado con datos propios, para que responda mejor en un dominio concreto.
  3. Poner un modelo base de terceros a trabajar sobre datos propios, con un buen sistema de recuperación de información (RAG), herramientas y un prompt bien construido, sin tocar los pesos del modelo.

Las tres se presentan como "tenemos IA propia". Solo la primera lo es en sentido estricto. La segunda es un modelo de terceros modificado. La tercera, la más habitual con diferencia, es un modelo de terceros sin modificar, al que se le da acceso a datos propios. Ninguna de las tres es mala: el problema es venderlas todas bajo el mismo nombre, porque el cliente paga la etiqueta creyendo que compra la primera.

Los tres niveles, sin humo

NivelQué es de verdadQué hace faltaPara quién tiene sentido
Entrenar desde ceroUna red neuronal nueva, entrenada con datos propios de principio a finVolúmenes de datos masivos, equipo especializado, meses de trabajoPrácticamente ninguna pyme; ni la mayoría de grandes empresas
Ajustar (fine-tuning)Un modelo base existente, reentrenado parcialmente con ejemplos propiosUn conjunto de datos curado y suficiente, y saber cuándo compensa frente a otras opcionesCasos muy concretos: un lenguaje o formato muy específico que el modelo base no domina bien
Modelo base + datos propios (RAG, herramientas, agente)El modelo no cambia; lo que cambia es a qué información y a qué acciones tiene accesoOrdenar el dato, construir la recuperación de información y las herramientas, integrar con el sistema realLa inmensa mayoría de negocios que quieren IA aplicada a su operación

La tabla deja claro algo que en las reuniones comerciales se difumina a propósito: el nivel que de verdad necesita casi cualquier empresa es el tercero, no el primero. Y el tercero no requiere entrenar nada: requiere tener el dato en condiciones y construir bien la integración. Es justo el ángulo que trabajamos en AutoBoost: primero se ordena el dato, luego se aplica la IA encima, no al revés.

La pregunta que lo desenmascara

No hace falta ser técnico para descubrir en qué nivel está tu proveedor. Basta con una pregunta con dos partes, y mirar si contesta las dos:

"¿Con qué datos entrenasteis el modelo, y qué modelo base corre por debajo?"

  • Si responde con nombres de datasets propios, tamaño del entrenamiento y tiempo de cómputo: nivel 1 o 2, de verdad propio o ajustado.
  • Si responde "eso es información confidencial de nuestra tecnología" sin dar ningún detalle concreto: sospecha alta, probablemente nivel 3 vendido como nivel 1.
  • Si responde con el nombre de un modelo comercial conocido (o lo evita activamente): nivel 3. No hay nada malo en ello, siempre que se venda como lo que es.

Esta es la regla de decisión que nos importa de verdad: si tu proveedor no puede decirte con qué datos entrenó o ajustó el modelo, ni qué modelo corre por debajo, no tiene un modelo propio: tiene un modelo de terceros con un sistema bien construido encima. Puede ser una solución excelente. Lo que no puede es cobrarse como si fuera la otra cosa.

Por qué esto le importa a quien dirige el negocio, no solo al técnico

Esta distinción no es un matiz de ingeniería, es una decisión de compra. Cambia tres cosas:

  • El precio que tiene sentido pagar. Entrenar un modelo desde cero es una inversión de otra magnitud que integrar un modelo existente con tu dato. Si te cobran como si fuera lo primero y en realidad es lo segundo, estás pagando de más por una etiqueta.
  • La dependencia real que asumes. Un modelo de verdad propio te ata al proveedor que lo entrenó. Un modelo base con datos propios encima te ata mucho menos: el dato y la integración son tuyos, el modelo se puede cambiar por debajo sin rehacer el proyecto entero.
  • Lo que puedes exigir si algo falla. Si el problema es que el modelo "no sabe" algo de tu negocio, la solución en el nivel 3 es mejorar el dato al que accede; en el nivel 1 o 2, hay que volver a entrenar, que es mucho más lento y caro.

Cuando montamos una plataforma de IA soberana con RAG sobre manuales técnicos para una empresa industrial, el modelo de lenguaje corre en España, sin salir de su infraestructura, y eso sí es un compromiso serio: no es "modelo propio" porque no se entrenó desde cero, es integración a medida con soberanía del dato, y así es como se cuenta, sin inflar la etiqueta.

Checklist antes de pagar por "modelo propio"

Antes de firmar con un proveedor que usa esa frase, pregunta esto y anota las respuestas:

  • ¿Con qué datos se entrenó o ajustó el modelo? (nombre del dataset, origen, volumen aproximado)
  • ¿Qué modelo base corre por debajo, si lo hay?
  • ¿Qué parte es entrenamiento y qué parte es recuperación de información sobre tus documentos?
  • Si cambias de proveedor de modelo base mañana, ¿qué se pierde de tu inversión y qué se queda contigo (el dato, la integración)?
  • ¿El precio refleja entrenar un modelo o integrar uno existente con tu sistema?

Si más de dos respuestas se quedan sin contestar con detalle, ya sabes en qué nivel estás negociando de verdad.

La etiqueta no es el problema, la confusión sí

No hay nada de malo en construir sobre un modelo base bien integrado con tu dato: es lo que necesita casi cualquier negocio y, bien hecho, es donde está el valor real. El problema es pagar la etiqueta de "modelo propio" sin saber cuál de los tres niveles estás comprando. En AutoBoost trabajamos en el nivel que de verdad mueve la aguja para una pyme: ordenar el dato e integrar la IA en el sistema real, software a medida, no plantillas genéricas. Si quieres que revisemos qué te están vendiendo, o qué necesitas de verdad, hablamos en /contacto.

Compartir artículo
IA "modelo propio": qué es de verdad y qué no | AutoBoost