Glosario

Lorem ipsum dolor sit amet, consectetur adipiscing elit, sed do eiusmod tempor incididunt ut labore et dolore magna aliqua. Ut enim ad minim veniam, quis nostrud exercitation ullamco laboris nisi ut aliquip ex ea commodo consequat.

A

Algoritmo

Conjunto finito de reglas bien definidas que un sistema sigue paso a paso para resolver un problema. El algoritmo es la receta; el modelo, el resultado de aplicarla sobre los datos.

Alucinación (Hallucination)

Respuesta plausible pero factualmente incorrecta generada por un modelo. Es el principal riesgo en despliegues sin control de fuentes.

Aprendizaje No Supervisado

Entrenamiento sin etiquetas: el modelo descubre estructura, clusters o patrones ocultos por sí mismo.

Aprendizaje por Refuerzo

Un agente aprende por prueba y error maximizando una recompensa. Base del RLHF usado para alinear los LLM.

Aprendizaje Supervisado

El modelo aprende a partir de pares entrada-salida etiquetados por humanos (ej.: emails marcados como spam / no spam).

B

Backpropagation

Algoritmo que propaga el error hacia atrás en una red neuronal para ajustar sus pesos. Es el motor del entrenamiento moderno de deep learning.

C

Clustering (Agrupamiento)

Técnica no supervisada que agrupa automáticamente datos similares en clusters, sin etiquetas previas (ej.: segmentar clientes).

D

Dataset (Conjunto de datos)

Colección estructurada de datos que alimenta a un modelo. Se divide en entrenamiento, validación y test. Su calidad pesa más que la del algoritmo.

Deep Learning

Subcampo del machine learning basado en redes neuronales profundas (múltiples capas) capaces de aprender representaciones jerárquicas.

E

Embedding

Representación vectorial (numérica) de un texto, imagen o entidad que captura su significado y permite comparar similitud semántica.

F

Feature Engineering

Crear, transformar y seleccionar las variables que mejor representan el problema para el modelo. En ML clásico, donde más se gana.

Fine-tuning

Ajuste especializado de un modelo preentrenado con datos propios para adaptarlo a un dominio, tono o tarea. Cambia los pesos internos, a diferencia del prompt o el RAG.

Function Calling / Tool Use

Capacidad de un LLM para invocar funciones o APIs externas de forma estructurada. Es el pegamento entre el modelo y tu software de negocio.

G

Gradiente Descendente

Algoritmo de optimización que ajusta los parámetros dando pequeños pasos en la dirección que más reduce el error.

H

Hiperparámetro

Valor que se fija antes de entrenar (tasa de aprendizaje, nº de capas, profundidad…) y condiciona cómo aprende el modelo. Se afina por prueba (tuning).

I

Inferencia

Fase en la que un modelo ya entrenado recibe datos nuevos y genera predicciones. En producción, su coste y latencia suelen importar más que los del entrenamiento.

J

JSON

Formato ligero de intercambio de datos basado en pares clave-valor. Estándar en APIs y en las salidas estructuradas de los LLM.

K

K-means

Algoritmo de clustering que divide los datos en k grupos según su cercanía a un centroide. Rápido y habitual como primera aproximación.

L

LLM (Large Language Model)

Modelo de lenguaje de gran escala entrenado sobre miles de millones de textos para comprender y generar lenguaje natural. Es el motor detrás de ChatGPT, Claude o Gemini; no «busca» respuestas, las predice palabra a palabra.

M

Machine Learning

Rama de la IA en la que los sistemas aprenden patrones a partir de datos, en lugar de seguir reglas programadas explícitamente.

MCP (Model Context Protocol)

Protocolo abierto que estandariza cómo los modelos se conectan a herramientas, bases de datos y sistemas externos, evitando integraciones ad-hoc.

N

Normalización

Ajuste de los datos a una escala común para que ninguna variable domine solo por su magnitud.

O

Overfitting (Sobreajuste)

El modelo memoriza los datos de entrenamiento en lugar de generalizar: brillante en el pasado, malo con datos nuevos.

P

Pipeline

Secuencia automatizada de pasos que mueve y transforma los datos desde el origen hasta el modelo o destino final. Hace el proceso repetible y auditable.

Prompt Engineering

Disciplina de diseñar las instrucciones que le das a un modelo para maximizar la calidad y precisión de la respuesta. Suele reducir errores más que cambiar de modelo.

Q

Query (Consulta)

Petición estructurada a una base de datos o sistema para recuperar o filtrar información. SQL es el lenguaje más extendido.

R

RAG (Retrieval-Augmented Generation)

Arquitectura que combina un LLM con una base documental propia: recupera los fragmentos relevantes y los inyecta en el contexto para responder con datos de tu empresa.

Red Neuronal

Modelo computacional inspirado en el cerebro, con capas de nodos conectados que transforman entradas en salidas.

T

Token

Unidad mínima de texto que procesa un LLM (aprox. 4 caracteres en español). Es la unidad de facturación habitual de las APIs de IA.

Transformer

Arquitectura de red neuronal basada en el mecanismo de atención (self-attention). Fundamento técnico de casi todos los LLM modernos.

U

Underfitting (Subajuste)

Lo contrario del overfitting: el modelo es demasiado simple y no capta los patrones ni en los datos de entrenamiento.

V

Vectorización

Conversión de datos (texto, imágenes, categorías) en vectores numéricos para procesarlos matemáticamente. Cuando captura significado, es un embedding.

Ventana de contexto (Context Window)

Cantidad máxima de tokens que un modelo procesa a la vez (entrada + salida). Determina cuánta información puede considerar en una sola llamada.

W

Web Scraping

Extracción automatizada de datos de páginas web para recopilarlos y analizarlos a escala. Conviene revisar siempre las condiciones legales de cada fuente.

X

XGBoost

Implementación optimizada de gradient boosting: combina muchos árboles débiles en un modelo fuerte. Referencia en datos tabulares.

Z

Zero-shot Learning

Capacidad de un modelo para resolver una tarea sin haber visto ejemplos específicos, apoyándose solo en la instrucción.