Palabras de IA, Explicadas

Toda conversación sobre IA está llena de palabras que la gente usa con seguridad y define con vaguedad — token, RAG, agente, MCP. Esta página da a cada una una definición clara, un ejemplo real y la confusión que hay que desaprender. Diez minutos, y serás la persona en la reunión que realmente sabe qué significan las palabras.

🎙️ Publicado y grabado:

01Token — la sílaba del modelo

Un modelo no lee letras ni palabras. El texto se trocea en tokens — fragmentos de aproximadamente ¾ de una palabra en inglés. "Unbelievable" podría ser un · believ · able. Todo en un modelo se mide en tokens: precio, velocidad, límites de memoria. Es el kilogramo del mundo de la IA.

"The quick brown fox" → ["The", " quick", " brown", " fox"]   // 4 tokens
"unbelievable"        → ["un", "believ", "able"]            // 3 tokens
"你好世界"             → a menudo 1 token por carácter o menos

// regla general: 1.000 tokens ≈ 750 palabras en inglés
// la API te cobra por token, de entrada Y de salida
Por qué debería importarte
Los tokens explican dos misterios cotidianos: por qué la factura cuenta tus documentos largos (los tokens de entrada también cuestan, no solo las respuestas), y por qué los modelos son extrañamente malos en "cuántas R tiene strawberry" — el modelo ve trozos tipo str·aw·berry, no letras. Está contando sílabas que tú no ves.

02Prompt y system prompt — la entrada, y la descripción del puesto

El prompt es todo lo que le envías al modelo — no solo tu pregunta, sino las instrucciones, ejemplos y documentos alrededor. El system prompt es un primer mensaje especial que el usuario nunca ve: la descripción del puesto del modelo ("Eres un agente de soporte de Acme; nunca hables de la competencia"). Cuando la IA de una app se comporta con personalidad, es el system prompt hablando.

// lo que realmente se envía a la API:
{
  "system": "You are a terse code reviewer. Point at lines. No praise.",
  "messages": [
    { "role": "user", "content": "Review this function: ..." }
  ]
}
La confusión habitual
"Prompt engineering" no son encantamientos mágicos ("actúa como un experto de clase mundial…"). Las técnicas que sobreviven a las pruebas son aburridas: muestra 2-3 ejemplos del resultado que quieres, indica el formato de salida explícitamente, y dale al modelo permiso para decir "no lo sé". Los ejemplos ganan a los adjetivos, siempre.

03Ventana de contexto — el escritorio del modelo, no su memoria

La ventana de contexto es cuántos tokens puede mirar el modelo a la vez — el tamaño de su escritorio. Un modelo con "200K de contexto" puede desplegar ~150.000 palabras sobre el escritorio. Punto crucial: el modelo no tiene memoria entre conversaciones. Cada chat nuevo empieza con un escritorio vacío, y "recordar" dentro de una conversación significa que la app reenvía silenciosamente todo el historial en cada turno.

// lo que "la IA recuerda nuestra conversación" realmente es:
turno 1:  enviar [msg1]                    → respuesta1
turno 2:  enviar [msg1, respuesta1, msg2]     → respuesta2
turno 3:  enviar [msg1, respuesta1, msg2, respuesta2, msg3] → ...

// nada se almacena en el modelo. La app reenvía
// toda la correspondencia con cada nuevo mensaje.
La confusión habitual
"Ventana más grande = usa todo por igual." No — los modelos prestan atención de forma desigual; lo que queda enterrado en medio de un contexto enorme se pierde (el efecto "lost in the middle"). Si una instrucción realmente importa, ponla al principio o al final, no en la página 40 del contrato pegado.

04Alucinación — autocompletar con confianza, no mentir

Una alucinación es el modelo afirmando algo falso con total confianza — un caso judicial que no existe, una función de API que nunca se escribió. No es mentir (mentir requiere intención). El modelo es un predictor de la siguiente palabra: cuando la respuesta verdadera no está en su conocimiento, la respuesta más estadísticamente plausible sale en su lugar, con gramática perfecta.

// la forma clásica del fallo:
Q: "What does the pandas function df.smooth_outliers() do?"
A: "df.smooth_outliers() applies rolling-window winsorization
   to columns exceeding 3 standard deviations..."   // ← no existe.
                                                    // descrita con belleza.
Defensas que funcionan
(1) Pide fuentes, y luego verifica una. (2) Dale al modelo el material de referencia en vez de confiar en su memoria — eso es RAG, sección 07. (3) Sospecha en proporción inversa a lo verificable que sea la afirmación: las alucinaciones en código fallan ruidosamente; las citas legales fallan en silencio hasta que un juez las lee. Las alucinaciones más peligrosas son las que no puedes compilar.

05Temperature — el ajuste del dado

En cada paso el modelo tiene una lista ordenada de posibles siguientes tokens. Temperature decide cómo elige: a 0, siempre toma la primera opción (casi la misma respuesta cada vez); valores más altos dan oportunidad a opciones peor clasificadas (variado, creativo, más arriesgado). No es un dial de "inteligencia" — es un dial de dados.

siguiente token después de "The capital of France is":
  " Paris"  92%   ← temperature 0 toma este, siempre
  " the"     3%
  " located" 2%   ← temperature 1.0 podría desviarse aquí
  ...

// extracción, código, evaluación  → temperature 0
// lluvia de ideas, nombres, ficción → 0.7 - 1.0

06Embedding — significado como coordenadas

Un embedding convierte texto en una lista de números — coordenadas en un espacio donde significados similares quedan cerca. "¿Cómo recupero mi contraseña?" y "olvidé mis credenciales" casi no comparten palabras, pero sus embeddings son vecinos. Eso es lo que permite "buscar por significado" — y es el motor dentro de RAG, la siguiente sección.

embed("How do I reset my password?")  → [0.12, -0.98, 0.44, ...]  // ~1000 números
embed("forgot my login credentials")  → [0.11, -0.95, 0.47, ...]  // ← ¡cercano!
embed("best pizza in Naples")         → [-0.71, 0.22, -0.30, ...] // ← lejos

// una "base de datos vectorial" es simplemente una herramienta
// para encontrar vecinos más cercanos en este espacio, rápido.

07RAG — un examen a libro abierto

Retrieval-Augmented Generation: en vez de pedirle al modelo que responda de memoria (a libro cerrado, propenso a alucinar), la app primero busca en tus documentos los pasajes relevantes — normalmente con embeddings — y los pega en el prompt. El modelo responde con lo que tiene en el escritorio. Cada producto de "chatea con tu PDF / docs / base de conocimiento" es esto.

el usuario pregunta: "¿Cuál es nuestra política de reembolso para planes anuales?"

1. generar embedding de la pregunta, encontrar los fragmentos más cercanos en tus docs
2. construir el prompt:
   "Usando SOLO estos extractos:
    [fragmento 12: 'Los planes anuales se pueden reembolsar en 30 días...']
    [fragmento 47: 'Los reembolsos se prorratean después de...']
    Responde: ¿Cuál es nuestra política de reembolso para planes anuales?"
3. el modelo responde desde los extractos — y puede citarlos
La advertencia honesta
La calidad de RAG es la calidad de la recuperación. Si el paso 1 trae los fragmentos equivocados, el modelo responde educadamente desde la página incorrecta — una alucinación con citas. Cuando un bot RAG es malo, depura la búsqueda, no el modelo. (Y muchas veces la solución ganadora es aburrida: mejor troceado de documentos.)

08Fine-tuning — entrenar los reflejos, no los hechos

Fine-tuning continúa el entrenamiento de un modelo con tus propios ejemplos, cambiando su comportamiento por defecto: tono, formato, estilo, vocabulario del dominio. La distinción crucial — fine-tuning enseña habilidades y hábitos, RAG proporciona hechos. Confundir estos dos es el malentendido más caro en IA aplicada.

// ¿quieres que el modelo SEPA tus docs del producto?     → RAG
// ¿quieres que ESCRIBA con la voz de tu equipo de soporte? → fine-tune
// ¿quieres ambos? → ambos. no son competidores.

✗ "Hicimos fine-tune con nuestra wiki para que sepa nuestras políticas"
   // ahora SUENA como tu wiki. los hechos siguen difusos,
   // ¿y el cambio de política de la semana pasada? no está ahí.
✓ fine-tune para el tono, RAG para el conocimiento

09Agente — un modelo en un bucle con herramientas

Un chatbot responde una vez. Un agente corre en un bucle: mirar el objetivo → elegir una herramienta (buscar, ejecutar código, leer un archivo, llamar a una API) → observar el resultado → decidir el siguiente paso → repetir hasta terminar. Las "herramientas" son funciones que el desarrollador le entrega al modelo, con descripciones. La agencia no es un tipo diferente de modelo — es un modelo con manos y permiso para iterar.

objetivo: "Encontrar por qué falló el deploy y arreglarlo"

bucle 1: herramienta=read_logs        → ve: ImportError in app.py
bucle 2: herramienta=read_file(app.py) → ve el import roto
bucle 3: herramienta=edit_file         → arregla la línea
bucle 4: herramienta=run_tests         → verde ✓ → informar y parar
La confusión habitual
"Los agentes son autónomos." En producción, la pregunta de diseño es exactamente la opuesta: dónde poner los frenos — qué acciones corren libres (lectura), cuáles necesitan aprobación (gastar dinero, enviar email, borrar). La calidad de un agente se muestra en su comportamiento al detenerse, no al arrancar.

10MCP y skills — el puerto USB y el manual de procedimientos

MCP (Model Context Protocol) es un enchufe estándar para conectar apps de IA con herramientas y datos. Antes: cada app escribía código personalizado para cada herramienta (Slack, GitHub, tu base de datos) — M×N integraciones. Con MCP, una herramienta expone un servidor MCP, cualquier app de IA que hable MCP puede usarla. Piensa en USB: un puerto, todo conecta. Un skill, mientras tanto, es un manual empaquetado — instrucciones (normalmente una carpeta con un archivo markdown y scripts) que enseñan al modelo cómo hacer una tarea específica a tu manera.

// MCP = acceso a cosas:
tu app de IA ──MCP──> github server    (leer PRs, crear issues)
             ──MCP──> postgres server  (consultar la base de datos)
             ──MCP──> slack server     (leer/enviar mensajes)

// skill = saber cómo hacer una tarea:
skills/deploy-checklist/SKILL.md
  "Antes de hacer deploy: ejecutar tests, verificar migraciones,
   publicar en #deploys, luego..."

// la herramienta da manos. el skill da la receta.

11Cheat sheet — una línea cada uno

Toda la página en once líneas. Roba esto para tu próxima reunión.

token           la sílaba del modelo; todo se cobra en estos
prompt          todo lo que envías: pregunta + instrucciones + ejemplos
system prompt   la descripción del puesto oculta
ventana contexto el escritorio, no la memoria — los chats reenvían todo
alucinación     autocompletar con confianza llenando un vacío de conocimiento
temperature     el dial del dado: 0 = misma respuesta, 1 = aventurero
embedding       significado como coordenadas; vecinos = similar
RAG             examen a libro abierto: buscar en tus docs, pegar, responder
fine-tuning     enseña hábitos y tono — NO hechos (eso es RAG)
agente          un modelo en un bucle con herramientas y un objetivo
MCP             el puerto USB: un enchufe estándar para IA ↔ herramientas
skill           un manual empaquetado: cómo hacer una tarea, a tu manera

El vocabulario es palanca: la mitad de la confusión en IA es gente usando la misma palabra para cosas distintas. Ahora tienes las definiciones funcionales — la próxima vez que alguien diga "simplemente haremos fine-tune con nuestros docs," sabrás exactamente qué pregunta hacer.