Va más allá de las palabras y trabaja a nivel de conceptos. Permite un razonamiento más profundo entre ideas y modalidades.
Proceso clave: Segmentación de oraciones, Embedding SONAR, Difusión y cuantización.
Ventaja: Razonamiento abstracto y multimodal.
LAM – Modelo de Acción de Gran Escala
No solo genera texto, toma acciones en el mundo real. Es la arquitectura detrás de los agentes inteligentes.
Incluye descomposición de tareas, planificación de acciones, memoria y retroalimentación.
MoE – Mezcla de Expertos
En lugar de usar un solo modelo gigante, combina múltiples expertos especializados. Un “router” decide qué expertos activar para cada consulta.
Ventaja: Menor costo computacional y mejor rendimiento.
Ejemplos: GPT-4, Mixtral
VLM – Modelo de Lenguaje Visual
Capaz de entender imágenes y texto al mismo tiempo. Combina codificadores visuales y de texto, proyección de alineación y procesador multimodal.
Ejemplos: GPT-4o, LLaVA.
SLM – Modelo de Lenguaje Pequeño
Modelos más ligeros y eficientes, diseñados para ejecutarse en dispositivos con recursos limitados como teléfonos móviles, ordenadores portátiles, edge computing, etc...
Ejemplos: Phi-3, Gemma, Mistral 7B.
MLM – Modelo de Lenguaje Enmascarado
Especializado en predecir palabras ocultas dentro de un texto (tarea de relleno de huecos).
Fue muy importante en el entrenamiento de modelos como BERT.
Usa atención bidireccional para entender el contexto completo.
SAM – Modelo Segmentador de Todo
Desarrollado por Meta, es capaz de segmentar cualquier objeto en una imagen a partir de un simple prompt.
Revolucionó la visión por computadora.