User Tag List

Página 34 de 34 PrimerPrimer ... 243031323334
Resultados 496 al 501 de 501

Tema: Me cag* en la Inteligencia Artificial pero me rindo a ella

  1. #496

    Fecha de ingreso
    Aug 2003
    Mensajes
    730
    Mencionado
    5 Post(s)
    Tagged
    0 Tema(s)
    Agradecer Thanks Given 
    12
    Agradecer Thanks Received 
    155
    Thanked in
    Agradecido 85 veces en [ARG:2 UNDEFINED] posts
    LLM (IA) en local con agentes

    Si, como desarrollador, me preguntan "¿ Cómo te ves usando LLMs para ayudarte al desarrollo ? ¿Te ves usando los servicios de IA de Claude, ChatGPT, mistral, kimi, deepseek en el futuro ?" pues diré: "Preferiré, siempre, usar un agente LLM en local, no sólo es más barato, si no que usa muchos menos recursos y tiene menos problemas éticos".

    Hay varios problemas hoy en día con los modelos en local, para explicarlos usaré varias preguntas y sus respuestas:

    - Pregunta: ¿Son los LLM en local lo suficientemente buenos para sustituir los mejores agentes online?
    - Respuesta: Sí, ya hay modelos en local tan buenos como los mejores LLM, quízá no tanto como los últimos modelos de OpenAI y Anthropic, pero están ahí ahí y si lo vemos con la perspectiva del tiempo, lo que hay en local hoy sin duda es mejor que lo que había hace 6 meses en OpenAI o Claude

    - Pregunta: ¿Es muy dificil lanzar modelos en local ?
    - Respuesta: Con Ollama está chupado, si has usado docker es casi igual; lanzarlos es un comando tipo `ollama run <tu modelo favorito>` aún así hay alternativas más complicadas pero que permiten afinar más los LLM locales.

    - Pregunta: ¿Pero hay LLM que funcionen en modo agente (ie: que programe por ti) integrado en el IDE/editor y que funcione como agente para que haga cambios de codigo en tus repos de git en local ?
    - Respuesta: Hay varias extensiones de distintos origenes incluyendo los oficiales de algunas plataformas que soportan Ollama, aunque fallan bastante todavía, hoy en día las extensiones de OpenAI o Claude, cuando funcionan, funcionan mejor.

    - Pregunta: ¿ Puedo lanzar cualquier modelo en local?
    - Respuesta: No. Éste es el GRAN problema, los modelos en local requieren mucha memoria RAM y VRAM (en la GPU), por lo que estamos limitados a lanzar modelos pequeños por un motivo que se explicará más adelante.

    - Pregunta: ¿Hay modelos pequeños (para poca VRAM y/o RAM) que funcionen bien?
    - Respuesta: Aunque cada semana sale un nuevo modelo pequeño que lo peta y es mejor que todo lo anterior, los modelos que pueden competir con ChatGPT o Claude necesitan una GPU potente. Sin suficiente memoria tarda muchísimos minutos en dar una respuestal; pero normalmente sin RAM acaba petando. Reducir el uso de memoria RAM de un modelo lo atonta y hace que de respuestas peores, o no funcione como se espera.

    - Pregunta: ¿Los modelos en local pueden cargar un contexto grande para, por ejemplo, cargar todo el codigo fuente de mis repositorios?
    - Respuesta: Los modelos en local suelen tener contextos grandes (desde 128k hasta 1 millón de tokens, que da para casi todo), pero estamos limitados por la VRAM y RAM disponibles.

    - Pregunta: ¿Pero entonces cuanta memoria RAM o VRAM hace falta? (Esta es la gran pregunta)
    - Respuesta: No hay ninguna GPU en el mercado de consumo a usuarios habituales con suficiente memoria para rular modelos decentes de manera que compita con ChatGPT/Codex, Claude o similares. Los Macs con memoria unificada, o algunos sistemas x86 o ARM con CPU y GPU integrados preparados para inferencia con memoria integrada también valen.

    - Pregunta: Entonces, si parece que es técnicamente viable usar LLM locales para todas las necesidades actuales de IA tanto para desarrolladores, científicos como usuarios en general, ¿por qué siguen existiendo ChatGPT o Claude y demás ?
    - Respuesta: Por el valor añadido extra de las plataformas (como ser marginalmente mejores, por las APIs, por las interfaces, por las apps), por la facilidad de uso y por la inercia misma de estar ahí antes que otros y haber logrado firmar contratos que hay que cumplir; pero sobre todo, en un porcentaje cada vez más grande de importancia: por el precio de los chips de memoria.

    Y ahora llego a lo que quería llegar:

    Por un lado los chips de memoria ham subido por que estan comprandolos para servidores de IA que están llenando los data centers; por otro, si las GPUs modernas (integradas en la CPU o no), si fueran asequibles y tuvieran suficiente RAM como hace falta para IA (por ejemplo >=64GB) la gran mayoria de las empresas y usuarios abandonarian las plataformas de OpenAI o Claude por motivos éticos, ecológicos y económicos; y estarían desde ese momento usando agentes en local.
    Por otro lado quien se beneficia de que los chips de memoria estén cada día más caros, sin que esto parezca que tenga solucion a la vista? Todas las empresas involucradas, desde OpenAI, pasando por nvidia, hasta los fabricantes de chips de memoria, que, "extrañamente", siguen estrangulando la producción de chips. Formando un cártel de empresas de tecnología IA que no sólo se rascan la espalda las unas a las otras, si no que todas ellas tienen participaciones unas en otras. Todo mientras construyen data centers que están provocando gravísimos problemas ecológicos, económicos y éticos en todos lados.

    Realmente, más allá de que cada díá es más probable que alguien involucrado acabe en la carcel por muchos motivos, a nivel más mundano es un poco frustrante no poder usar un LLM local por que necesito gastar miles de euros si quiero tener un agente en local que funcione de manera decente con modelos de gran tamaño.

  2. El siguiente usuario agradece a amkam este mensaje:

    fbustamante (Ayer)

  3. #497

    Fecha de ingreso
    Mar 2007
    Ubicación
    Barna
    Mensajes
    10,743
    Mencionado
    94 Post(s)
    Tagged
    0 Tema(s)
    Agradecer Thanks Given 
    518
    Agradecer Thanks Received 
    2,264
    Thanked in
    Agradecido 1,192 veces en [ARG:2 UNDEFINED] posts
    Claro que se pueden lanzar cosas en local que hacen el apaño, especialmente los modelos chinos. Pero para llegar a la potencia similar a los grandes necesitas un equipo que cuesta miles de euros, que es lo que cuesta pagar subscripción a chatgpt o Claude por una década. Tienes que ser muy poweruser para que económicamente tenga sentido.

    Yo tengo ollama en local para chorraditas de textos tipo generación de historias. Cuando tenga un rato intentaré instalarlo en un macmini que tengo por ahí sin usar. Pero es eso, modelos chiquitines de juguete que pueda ejecutar con la memoria de mis dispositivos que ya tengo. Si tuviese que comprar un dispositivo nuevo y potente, no me salen las cuentas comparando con subscripción.

    Sobre motivos éticos para usar modelos en local, se me escapan. Motivos de ciberseguridad sí, para impedir enviar información a saber a quién.

    -----Actualizado-----

    Cita Iniciado por amkam Ver mensaje
    si las GPUs modernas (integradas en la CPU o no), si fueran asequibles y tuvieran suficiente RAM como hace falta para IA (por ejemplo >=64GB)
    Que poco ambicioso eres con ese presente hipotético. Ya que es hipotético, hazlo a lo grande. Si un limón tuviese suficiente RAM para IA, mi limonero tendría potencia suficiente para calcular la mejor estrategia para alcanzar la paz mundial.

  4. #498

    Fecha de ingreso
    Sep 2006
    Ubicación
    Malaga
    Mensajes
    8,490
    Mencionado
    51 Post(s)
    Tagged
    0 Tema(s)
    Agradecer Thanks Given 
    2,116
    Agradecer Thanks Received 
    2,610
    Thanked in
    Agradecido 1,727 veces en [ARG:2 UNDEFINED] posts
    Se supone que para correrlo en local en verdad no necesitas tanta RAM, lo que necesitas es poder hacer streaming de forma eficiente debido a que no es necesario tener toda la red en memoria, por eso los macmini van bien, tienes velocidad rapida del SSD a la RAM y al tener memoria unificada no hay que copiar los datos a la GPU, los lee directamente de la RAM.
    No es lo mismo tener diez años de experiencia, que tener un año de experiencia diez veces.


    It is an undisputed truth that the Atari ST gets the best out of coders. No dedicated hardware, just the CPU and a frame buffer! Some call it Spartan, others name it Power Without The Price, and a select few say `challenge accepted'! --- by spkr from smfx

  5. #499

    Fecha de ingreso
    Aug 2003
    Mensajes
    730
    Mencionado
    5 Post(s)
    Tagged
    0 Tema(s)
    Agradecer Thanks Given 
    12
    Agradecer Thanks Received 
    155
    Thanked in
    Agradecido 85 veces en [ARG:2 UNDEFINED] posts
    Cita Iniciado por juanvvc Ver mensaje
    Claro que se pueden lanzar cosas en local que hacen el apaño, especialmente los modelos chinos. Pero para llegar a la potencia similar a los grandes necesitas un equipo que cuesta miles de euros, que es lo que cuesta pagar subscripción a chatgpt o Claude por una década. Tienes que ser muy poweruser para que económicamente tenga sentido.
    No digo que "a veces" funcione, digo que algo funcione bien la mayor parte del tiempo; algo que funcione de manera estable y confiable el 99% del tiempo, a nivel profesional no me vale con un 50% (eso quizás como tu dices, para hacer un apaño como usuario), como profesional y como empresa quiero que funcione de manera confiable hoy, mañana y al otro también. No que me haga "algun apaño", algo que dependiendo del contexto, a veces funcione y otras te tires 15 minutos esperando una respuesta para al final acabar petando, no sólo quiero que sea rapido, si no que sea estable y consistente, es ahí donde queremos modelos gordos (bueno, y pulir un poco las apps). Que no se me tache de falta de ambición

    Hoy por hoy (y sé que esto envejecerá muy mal, por suerte), no he visto ningún modelo que funcione a velocidad aceptable, de forma predecible y bien (casi siempre) en una GPU de 12GB de VRAM, lo mismo con un Mac M3 Max con 36GB de RAM unificada. Estoy hablando de qwen 3.5, 3.6, gemma4, ornith, kimi, etc. Cuando no es una cosa (poca ram, la quantización es demasiado agresiva) es la otra (la extensión para el IDE no funciona bien, el contexto es demasiado pequeño y no entra en el modelo, entra en bucle, etc.).

    No he entendido lo del limonero.

  6. #500

    Fecha de ingreso
    Sep 2005
    Mensajes
    16,996
    Mencionado
    284 Post(s)
    Tagged
    1 Tema(s)
    Agradecer Thanks Given 
    1,239
    Agradecer Thanks Received 
    2,750
    Thanked in
    Agradecido 1,893 veces en [ARG:2 UNDEFINED] posts
    Por lo poco que he leído, el problema actual es que los modelos de las grandes empresas no caben en los equipos locales. Mira que yo tengo 17GB de VRAM en mi equipo, y aún así, no me acerco ni a la 1/5 parte de lo que se usaba en OpenAI hace un año... o algo así.
    Pero es lo que dice Juanvvc: se necesita un pedazo de equipo para hacer funcionar el modelo, con muchísima RAM (no sé si se puede "streamear" los datos, teniendo en cuenta que se hacen operaciones en paralelo), y no compensa a los precios que nos ofrecen (a lo que hay que sumar los ahorros de costes de producción de la empresa que contrata sus servicios). Además, el tenerlo en un servidor permite hacer uso de ejecuciones paralelas, si es posible, crear buffer de datos reutilizables, y luego está el tema del mantenimiento, que ya se encargan de configurar las IAs para que den el mejor resultado (y ya os digo que no es tarea fácil), o de tener las máquinas a punto todo el rato.

    De hecho, si es por eticidad por el consumo, creo que los datacenter son más "éticos" porque consumen menos que miles de ordenadores independientes ejecutando IAs.

    Lo que supongo que se refiere Juanvvc con el limonero es que siempre puedes hacer una granja de GPUs, como las que usaban para minar cryptos.
    Que esa es otra, un equipo de IA para uso doméstico es caro, pero todas las empresas tienen su sala de servidores, y ahí es mucho más barato y plausible ejecutar un modelo local.
    Es sólo que los modelos actuales no están optimizados, ni los equipos están adaptados a la IA, por falta de RAM. ¿No se había diseñado un procesador específico para ejecutar IA? ¿No estaban metiendo núcleos de eso en los móviles? ¿Eso no mejora la eficiencia? Espera que se puedan sustituir las GPUs por tarjetas específicas para IA... que seguro que NVidia tiene ya varios productos de esos.
    Última edición por Drumpi; Ayer a las 14:54
    PROYECTOS REALIZADOS: FrikiMusic, Motor Scroll Tileado v3.2, Venturer2X (GP2X/WIZ), Echo, Screen Break Time
    PROYECTOS EN MARCHA (algunos): Bennu GP2X: 95% (necesito ayuda) ¡Antes de Halloween!: 92% SpaceH2H: 8%

  7. #501

    Fecha de ingreso
    Mar 2007
    Ubicación
    Barna
    Mensajes
    10,743
    Mencionado
    94 Post(s)
    Tagged
    0 Tema(s)
    Agradecer Thanks Given 
    518
    Agradecer Thanks Received 
    2,264
    Thanked in
    Agradecido 1,192 veces en [ARG:2 UNDEFINED] posts
    Con lo del limonero, me referia a que las construcciones "si X entonces Y" son ciertas desde el punto de vista lógico, pero inútiles si X no es verdad.

    Si mi abuela tuviese ruedas sería una bicicleta

    Y ademas aquí se junta con un oxímoron

    Si la IA pudiese ejecutarse en local no necesitaríamos que se ejecute en remoto

    Pues claro, pero no es así.

    Ojalá la IA útil pudiese ejecutarse en local. Pero no puede, así que para qué perder energia mental en considerar ese escenario y mejor adaptarse a lo que sí que hay.

    Cuando los inegnieros ingenien algo pues ya veriamos, pero hoy por hoy es inútil lamentarse porque mi limonero no pueda acabar con las guerras.

Página 34 de 34 PrimerPrimer ... 243031323334

Permisos de publicación

  • No puedes crear nuevos temas
  • No puedes responder temas
  • No puedes subir archivos adjuntos
  • No puedes editar tus mensajes
  •