Toda conversación sobre IA está llena de palabras que la gente usa con seguridad y define con vaguedad — token, RAG, agente, MCP. Esta página da a cada una una definición clara, un ejemplo real y la confusión que hay que desaprender. Diez minutos, y serás la persona en la reunión que realmente sabe qué significan las palabras.
🎙️ Publicado y grabado:
Un modelo no lee letras ni palabras. El texto se trocea en tokens — fragmentos de aproximadamente ¾ de una palabra en inglés. "Unbelievable" podría ser un · believ · able. Todo en un modelo se mide en tokens: precio, velocidad, límites de memoria. Es el kilogramo del mundo de la IA.
"The quick brown fox" → ["The", " quick", " brown", " fox"] // 4 tokens
"unbelievable" → ["un", "believ", "able"] // 3 tokens
"你好世界" → a menudo 1 token por carácter o menos
// regla general: 1.000 tokens ≈ 750 palabras en inglés
// la API te cobra por token, de entrada Y de salida
str·aw·berry, no letras. Está contando sílabas que tú no ves.
El prompt es todo lo que le envías al modelo — no solo tu pregunta, sino las instrucciones, ejemplos y documentos alrededor. El system prompt es un primer mensaje especial que el usuario nunca ve: la descripción del puesto del modelo ("Eres un agente de soporte de Acme; nunca hables de la competencia"). Cuando la IA de una app se comporta con personalidad, es el system prompt hablando.
// lo que realmente se envía a la API:
{
"system": "You are a terse code reviewer. Point at lines. No praise.",
"messages": [
{ "role": "user", "content": "Review this function: ..." }
]
}
La ventana de contexto es cuántos tokens puede mirar el modelo a la vez — el tamaño de su escritorio. Un modelo con "200K de contexto" puede desplegar ~150.000 palabras sobre el escritorio. Punto crucial: el modelo no tiene memoria entre conversaciones. Cada chat nuevo empieza con un escritorio vacío, y "recordar" dentro de una conversación significa que la app reenvía silenciosamente todo el historial en cada turno.
// lo que "la IA recuerda nuestra conversación" realmente es:
turno 1: enviar [msg1] → respuesta1
turno 2: enviar [msg1, respuesta1, msg2] → respuesta2
turno 3: enviar [msg1, respuesta1, msg2, respuesta2, msg3] → ...
// nada se almacena en el modelo. La app reenvía
// toda la correspondencia con cada nuevo mensaje.
Una alucinación es el modelo afirmando algo falso con total confianza — un caso judicial que no existe, una función de API que nunca se escribió. No es mentir (mentir requiere intención). El modelo es un predictor de la siguiente palabra: cuando la respuesta verdadera no está en su conocimiento, la respuesta más estadísticamente plausible sale en su lugar, con gramática perfecta.
// la forma clásica del fallo:
Q: "What does the pandas function df.smooth_outliers() do?"
A: "df.smooth_outliers() applies rolling-window winsorization
to columns exceeding 3 standard deviations..." // ← no existe.
// descrita con belleza.
En cada paso el modelo tiene una lista ordenada de posibles siguientes tokens. Temperature decide cómo elige: a 0, siempre toma la primera opción (casi la misma respuesta cada vez); valores más altos dan oportunidad a opciones peor clasificadas (variado, creativo, más arriesgado). No es un dial de "inteligencia" — es un dial de dados.
siguiente token después de "The capital of France is":
" Paris" 92% ← temperature 0 toma este, siempre
" the" 3%
" located" 2% ← temperature 1.0 podría desviarse aquí
...
// extracción, código, evaluación → temperature 0
// lluvia de ideas, nombres, ficción → 0.7 - 1.0
Un embedding convierte texto en una lista de números — coordenadas en un espacio donde significados similares quedan cerca. "¿Cómo recupero mi contraseña?" y "olvidé mis credenciales" casi no comparten palabras, pero sus embeddings son vecinos. Eso es lo que permite "buscar por significado" — y es el motor dentro de RAG, la siguiente sección.
embed("How do I reset my password?") → [0.12, -0.98, 0.44, ...] // ~1000 números
embed("forgot my login credentials") → [0.11, -0.95, 0.47, ...] // ← ¡cercano!
embed("best pizza in Naples") → [-0.71, 0.22, -0.30, ...] // ← lejos
// una "base de datos vectorial" es simplemente una herramienta
// para encontrar vecinos más cercanos en este espacio, rápido.
Retrieval-Augmented Generation: en vez de pedirle al modelo que responda de memoria (a libro cerrado, propenso a alucinar), la app primero busca en tus documentos los pasajes relevantes — normalmente con embeddings — y los pega en el prompt. El modelo responde con lo que tiene en el escritorio. Cada producto de "chatea con tu PDF / docs / base de conocimiento" es esto.
el usuario pregunta: "¿Cuál es nuestra política de reembolso para planes anuales?"
1. generar embedding de la pregunta, encontrar los fragmentos más cercanos en tus docs
2. construir el prompt:
"Usando SOLO estos extractos:
[fragmento 12: 'Los planes anuales se pueden reembolsar en 30 días...']
[fragmento 47: 'Los reembolsos se prorratean después de...']
Responde: ¿Cuál es nuestra política de reembolso para planes anuales?"
3. el modelo responde desde los extractos — y puede citarlos
Fine-tuning continúa el entrenamiento de un modelo con tus propios ejemplos, cambiando su comportamiento por defecto: tono, formato, estilo, vocabulario del dominio. La distinción crucial — fine-tuning enseña habilidades y hábitos, RAG proporciona hechos. Confundir estos dos es el malentendido más caro en IA aplicada.
// ¿quieres que el modelo SEPA tus docs del producto? → RAG
// ¿quieres que ESCRIBA con la voz de tu equipo de soporte? → fine-tune
// ¿quieres ambos? → ambos. no son competidores.
✗ "Hicimos fine-tune con nuestra wiki para que sepa nuestras políticas"
// ahora SUENA como tu wiki. los hechos siguen difusos,
// ¿y el cambio de política de la semana pasada? no está ahí.
✓ fine-tune para el tono, RAG para el conocimiento
Un chatbot responde una vez. Un agente corre en un bucle: mirar el objetivo → elegir una herramienta (buscar, ejecutar código, leer un archivo, llamar a una API) → observar el resultado → decidir el siguiente paso → repetir hasta terminar. Las "herramientas" son funciones que el desarrollador le entrega al modelo, con descripciones. La agencia no es un tipo diferente de modelo — es un modelo con manos y permiso para iterar.
objetivo: "Encontrar por qué falló el deploy y arreglarlo"
bucle 1: herramienta=read_logs → ve: ImportError in app.py
bucle 2: herramienta=read_file(app.py) → ve el import roto
bucle 3: herramienta=edit_file → arregla la línea
bucle 4: herramienta=run_tests → verde ✓ → informar y parar
MCP (Model Context Protocol) es un enchufe estándar para conectar apps de IA con herramientas y datos. Antes: cada app escribía código personalizado para cada herramienta (Slack, GitHub, tu base de datos) — M×N integraciones. Con MCP, una herramienta expone un servidor MCP, cualquier app de IA que hable MCP puede usarla. Piensa en USB: un puerto, todo conecta. Un skill, mientras tanto, es un manual empaquetado — instrucciones (normalmente una carpeta con un archivo markdown y scripts) que enseñan al modelo cómo hacer una tarea específica a tu manera.
// MCP = acceso a cosas:
tu app de IA ──MCP──> github server (leer PRs, crear issues)
──MCP──> postgres server (consultar la base de datos)
──MCP──> slack server (leer/enviar mensajes)
// skill = saber cómo hacer una tarea:
skills/deploy-checklist/SKILL.md
"Antes de hacer deploy: ejecutar tests, verificar migraciones,
publicar en #deploys, luego..."
// la herramienta da manos. el skill da la receta.
Toda la página en once líneas. Roba esto para tu próxima reunión.
token la sílaba del modelo; todo se cobra en estos
prompt todo lo que envías: pregunta + instrucciones + ejemplos
system prompt la descripción del puesto oculta
ventana contexto el escritorio, no la memoria — los chats reenvían todo
alucinación autocompletar con confianza llenando un vacío de conocimiento
temperature el dial del dado: 0 = misma respuesta, 1 = aventurero
embedding significado como coordenadas; vecinos = similar
RAG examen a libro abierto: buscar en tus docs, pegar, responder
fine-tuning enseña hábitos y tono — NO hechos (eso es RAG)
agente un modelo en un bucle con herramientas y un objetivo
MCP el puerto USB: un enchufe estándar para IA ↔ herramientas
skill un manual empaquetado: cómo hacer una tarea, a tu manera
El vocabulario es palanca: la mitad de la confusión en IA es gente usando la misma palabra para cosas distintas. Ahora tienes las definiciones funcionales — la próxima vez que alguien diga "simplemente haremos fine-tune con nuestros docs," sabrás exactamente qué pregunta hacer.