LLM (IA) en local con agentes
Si, como desarrollador, me preguntan "¿ Cómo te ves usando LLMs para ayudarte al desarrollo ? ¿Te ves usando los servicios de IA de Claude, ChatGPT, mistral, kimi, deepseek en el futuro ?" pues diré: "Preferiré, siempre, usar un agente LLM en local, no sólo es más barato, si no que usa muchos menos recursos y tiene menos problemas éticos".
Hay varios problemas hoy en día con los modelos en local, para explicarlos usaré varias preguntas y sus respuestas:
- Pregunta: ¿Son los LLM en local lo suficientemente buenos para sustituir los mejores agentes online?
- Respuesta: Sí, ya hay modelos en local tan buenos como los mejores LLM, quízá no tanto como los últimos modelos de OpenAI y Anthropic, pero están ahí ahí y si lo vemos con la perspectiva del tiempo, lo que hay en local hoy sin duda es mejor que lo que había hace 6 meses en OpenAI o Claude
- Pregunta: ¿Es muy dificil lanzar modelos en local ?
- Respuesta: Con Ollama está chupado, si has usado docker es casi igual; lanzarlos es un comando tipo `ollama run <tu modelo favorito>` aún así hay alternativas más complicadas pero que permiten afinar más los LLM locales.
- Pregunta: ¿Pero hay LLM que funcionen en modo agente (ie: que programe por ti) integrado en el IDE/editor y que funcione como agente para que haga cambios de codigo en tus repos de git en local ?
- Respuesta: Hay varias extensiones de distintos origenes incluyendo los oficiales de algunas plataformas que soportan Ollama, aunque fallan bastante todavía, hoy en día las extensiones de OpenAI o Claude, cuando funcionan, funcionan mejor.
- Pregunta: ¿ Puedo lanzar cualquier modelo en local?
- Respuesta: No. Éste es el GRAN problema, los modelos en local requieren mucha memoria RAM y VRAM (en la GPU), por lo que estamos limitados a lanzar modelos pequeños por un motivo que se explicará más adelante.
- Pregunta: ¿Hay modelos pequeños (para poca VRAM y/o RAM) que funcionen bien?
- Respuesta: Aunque cada semana sale un nuevo modelo pequeño que lo peta y es mejor que todo lo anterior, los modelos que pueden competir con ChatGPT o Claude necesitan una GPU potente. Sin suficiente memoria tarda muchísimos minutos en dar una respuestal; pero normalmente sin RAM acaba petando. Reducir el uso de memoria RAM de un modelo lo atonta y hace que de respuestas peores, o no funcione como se espera.
- Pregunta: ¿Los modelos en local pueden cargar un contexto grande para, por ejemplo, cargar todo el codigo fuente de mis repositorios?
- Respuesta: Los modelos en local suelen tener contextos grandes (desde 128k hasta 1 millón de tokens, que da para casi todo), pero estamos limitados por la VRAM y RAM disponibles.
- Pregunta: ¿Pero entonces cuanta memoria RAM o VRAM hace falta? (Esta es la gran pregunta)
- Respuesta: No hay ninguna GPU en el mercado de consumo a usuarios habituales con suficiente memoria para rular modelos decentes de manera que compita con ChatGPT/Codex, Claude o similares. Los Macs con memoria unificada, o algunos sistemas x86 o ARM con CPU y GPU integrados preparados para inferencia con memoria integrada también valen.
- Pregunta: Entonces, si parece que es técnicamente viable usar LLM locales para todas las necesidades actuales de IA tanto para desarrolladores, científicos como usuarios en general, ¿por qué siguen existiendo ChatGPT o Claude y demás ?
- Respuesta: Por el valor añadido extra de las plataformas (como ser marginalmente mejores, por las APIs, por las interfaces, por las apps), por la facilidad de uso y por la inercia misma de estar ahí antes que otros y haber logrado firmar contratos que hay que cumplir; pero sobre todo, en un porcentaje cada vez más grande de importancia: por el precio de los chips de memoria.
Y ahora llego a lo que quería llegar:
Por un lado los chips de memoria ham subido por que estan comprandolos para servidores de IA que están llenando los data centers; por otro, si las GPUs modernas (integradas en la CPU o no), si fueran asequibles y tuvieran suficiente RAM como hace falta para IA (por ejemplo >=64GB) la gran mayoria de las empresas y usuarios abandonarian las plataformas de OpenAI o Claude por motivos éticos, ecológicos y económicos; y estarían desde ese momento usando agentes en local.
Por otro lado quien se beneficia de que los chips de memoria estén cada día más caros, sin que esto parezca que tenga solucion a la vista? Todas las empresas involucradas, desde OpenAI, pasando por nvidia, hasta los fabricantes de chips de memoria, que, "extrañamente", siguen estrangulando la producción de chips. Formando un cártel de empresas de tecnología IA que no sólo se rascan la espalda las unas a las otras, si no que todas ellas tienen participaciones unas en otras. Todo mientras construyen data centers que están provocando gravísimos problemas ecológicos, económicos y éticos en todos lados.
Realmente, más allá de que cada díá es más probable que alguien involucrado acabe en la carcel por muchos motivos, a nivel más mundano es un poco frustrante no poder usar un LLM local por que necesito gastar miles de euros si quiero tener un agente en local que funcione de manera decente con modelos de gran tamaño.


Citar


Marcadores