Skip to main content Skip to course navigation

Los Modelos de Lenguaje Grande (LLMs) Detrás de Escena

Objetivo de la lección

Al finalizar esta lección, el estudiante comprenderá qué es un Modelo de Lenguaje Grande (LLM), cómo se entrena a nivel general, qué son los parámetros y los tokens, y la importancia de la arquitectura Transformer como el motor detrás de Gemini.

1. ¿Qué es exactamente un LLM?

Un LLM (Large Language Model) es un programa de inteligencia artificial diseñado para entender, procesar y generar lenguaje humano a gran escala.

Para que un modelo sea considerado «Grande», necesita dos cosas:

  • Un volumen de datos masivo: Textos de libros, artículos científicos, código de programación, sitios web y repositorios públicos.

  • Una infraestructura de computación gigantesca: Miles de procesadores especializados (como las TPUs de Google) trabajando en paralelo durante meses para procesar esa información.

2. Los tres pilares técnicos: Tokens, Parámetros y Contexto

Para entender cómo «piensa» un LLM como Gemini, debemos dominar tres conceptos fundamentales:

  • Los Tokens (Las unidades de construcción): Los LLMs no leen palabras completas como los humanos; fragmentan el texto en «tokens» (que pueden ser sílabas, palabras cortas o caracteres). Por ejemplo, la palabra «computadora» podría dividirse en 3 tokens: compu, ta, dora.

  • Los Parámetros (Las conexiones del cerebro): Son las variables internas del modelo que se ajustan durante el entrenamiento. Piensa en ellos como «perillas» o conexiones neuronales. Cuantos más parámetros tiene un modelo (a menudo miles de millones), mayor es su capacidad para captar matices, sutilezas y relaciones complejas en los datos.

  • La Ventana de Contexto (La memoria a corto plazo): Es la cantidad máxima de tokens que el modelo puede procesar y «recordar» en una sola interacción (tanto tu pregunta como su respuesta). Modelos avanzados como Gemini destacan precisamente por tener ventanas de contexto masivas, permitiéndoles analizar documentos enteros o código extenso de una sola vez.

3. El motor secreto: La Arquitectura Transformer

En 2017, un equipo de científicos de Google publicó un artículo técnico histórico titulado «Attention Is All You Need», introduciendo la arquitectura Transformer. Esta innovación cambió la IA para siempre gracias a dos capacidades clave:

  1. Mecanismo de Atención (Self-Attention): Permite al modelo evaluar la relación entre todas las palabras de una frase, sin importar qué tan lejos estén unas de otras.

    📌 Ejemplo: En la frase «El banco de madera estaba cerca del banco financiero», el mecanismo de atención le permite a la IA asociar la primera palabra «banco» con «madera», entendiendo inmediatamente el contexto correcto de cada término.

  2. Procesamiento en Paralelo: A diferencia de las tecnologías anteriores que leían palabra por palabra de forma secuencial (como un humano), los Transformers pueden procesar bloques gigantescos de texto al mismo tiempo, acelerando drásticamente el entrenamiento.

4. El proceso de entrenamiento: Del caos al refinamiento

Un LLM no nace sabiendo hablar formalmente. Pasa por dos etapas críticas:

  1. Pre-entrenamiento (Auto-supervisado): El modelo lee la web masivamente y juega a «adivinar la siguiente palabra». Aquí aprende gramática, hechos sobre el mundo y lógica básica. Sin embargo, en esta etapa solo es un auto-completador salvaje.

  2. Ajuste Fino (Fine-Tuning y RLHF): Mediante el Ajuste Fino Supervisado y el Aprendizaje por Refuerzo con Retroalimentación Humana (RLHF), entrenadores humanos guían al modelo para que aprenda a seguir instrucciones, sea servicial, seguro, evite contenido dañino y adopte un tono profesional.

Actividad Práctica: Auditoría de Contexto y Tokenización

Objetivo de la actividad: Comprender de forma empírica cómo las limitaciones de la ventana de contexto y la estructura de los tokens afectan el rendimiento y la precisión de un LLM.

Instrucciones para el estudiante:

  1. Preparación del escenario: Inicie una nueva conversación limpia en Google Gemini.

  2. Simulación de sobrecarga de contexto simulada: Copie y pegue un fragmento extenso de texto técnico (puede ser un artículo de blog corporativo o los términos de servicio de una plataforma, de aproximadamente 3 o 4 páginas de extensión) en el chat.

  3. Ejecución del Prompt de Auditoría: Al final del texto pegado, añada la siguiente instrucción:

    «Analiza el texto anterior. 1) Genera un resumen ejecutivo de 3 puntos clave. 2) Identifica si el modelo extrajo algún dato numérico o estadístico específico. 3) Evalúa si la respuesta omitió alguna sección del inicio o del final debido a la extensión.»

  4. Análisis crítico: Revise el resultado y responda en su bitácora de clase:

    • ¿El modelo fue capaz de cruzar información del principio y del final del documento de manera coherente (Mecanismo de Atención)?

    • Si modifica una sola palabra clave por un término técnico inexistente (ej. inventar un acrónimo como XT-900), ¿cómo reacciona el modelo al procesar ese nuevo «token»?