
Uno de los motivos por el que la gráfica NVIDIA RTX 5090 es la mejor opción para tareas de Inteligencia Artificial de forma local es por contar con 32 GB de VRAM. Las IA necesitan mucha VRAM porque durante la inferencia (cuando generan una respuesta) y el entrenamiento tienen que mantener una enorme cantidad de datos accesibles de forma inmediata.
Si toda la información no cabe en la VRAM, memoria mucho más rápida que la RAM, la Inteligencia Artificial tiene que recurrir a la memoria RAM del equipo, ralentizando los procesos de inferencia y entrenamiento.
El proceso de entrenamiento de una IA consume todavía más memoria que el proceso de inferencia, concretamente entre 3 y 8 veces más memoria. Este es uno de los motivos por el que las gráficas de uso doméstico de AMD, Intel y NVIDIA no se utilizan para entrenar modelos de lenguaje, sino para ejecutarlos.
¿Por qué la IA consume tanta VRAM?
El elevado consumo de VRAM de la Inteligencia Artificial se debe a tres factores:
Los parámetros del modelo
Cuando hablamos de parámetros de un LLM, hablamos del conjunto de datos que define todo lo que sabe. Por ejemplo, Llama-3-8B, cuenta con 8.000 millones de parámetros. Cada uno de esos parámetros es un número decimal y dependiendo de la precisión con la que se guarden, ocupan más o menos espacio.
- FP16 (sin compresión). Cada parámetro ocupa 2 bytes. Para calcular la cantidad de memoria que necesitamos para abrir un modelo con 8.000 millones de parámetros, debemos multiplicar esa cifra por 2 bytes y nos da un total de 16 GB, cantidad de VRAM solo necesaria para abrir el modelo.
- INT4 (comprimido). Utilizando diferentes técnicas de compresión se reduce el tamaño de 0,5 bytes por parámetro. De esta forma, para abrir un modelo de lenguaje con 8.000 millones de parámetros, solo necesitamos 6 GB VRAM.
| Parámetros del Modelo | Precisión FP16 (16 bits) | Cuantización INT4 (4 bits) |
|---|---|---|
| 7B (7.000 millones) | ~14 GB | ~4–5 GB |
| 13B (13.000 millones) | ~26 GB | ~8–10 GB |
| 70B (70.000 millones) | >140 GB | ~40–50 GB |
La memoria a corto plazo
Cargar el modelo es solo el principio. Cuando estás interactuando con una IA, cada vez que genera un nuevo token (la unidad de medida que usa el modelo, que suele ser una palabra corta o parte de una de ella), necesita recordar todo lo que se ha dicho antes en la conversación.
Para no recalcular el significado de todo el texto desde cero con cada token nuevo, la tarjeta gráfica guarda las operaciones anteriores en un búfer llamado KV Cache.
Esta caché crece de forma lineal con la cantidad de tokens del texto (contexto) y el número de usuarios simultáneos. Si le pides a la IA que analice un PDF de 200 páginas o mantienes una conversación larguísima, el KV Cache puede llegar a ocupar fácilmente más VRAM que el propio modelo.
from Hard Zone : Hardware, Reviews, Noticias, Tutoriales, Foros de ayuda https://ift.tt/VdfSqkr
via IFTTT
No hay comentarios:
Publicar un comentario