Los enjambres de agentes, explicados: cómo ejecutar muchos modelos de IA a la vez está transformando la economía de costos

Durante los primeros años del auge de los asistentes de programación con IA, el modelo básico de interacción se mantuvo prácticamente igual: un desarrollador le pide algo a un único modelo de IA, el modelo produce una respuesta o un cambio de código, y el desarrollador lo revisa. Un enfoque más reciente, cada vez más discutido bajo el término 'enjambres de agentes', rompe ese patrón al desplegar muchos agentes de IA para trabajar simultáneamente en variaciones del mismo problema, y luego seleccionar o fusionar los mejores resultados.
La mecánica básica es sencilla, aunque la economía detrás de ella no lo sea. En lugar de enviar una única instrucción a una única instancia de modelo y esperar una sola respuesta, un sistema basado en enjambre podría lanzar diez, veinte o más instancias de agentes en paralelo, cada una intentando de forma independiente la misma tarea de programación, a veces con estrategias, condiciones iniciales o incluso modelos subyacentes completamente distintos.
El atractivo es similar a la lógica detrás de los métodos de conjunto en el aprendizaje automático tradicional: cualquier intento único de una IA en una tarea de programación no trivial conlleva un riesgo real de producir una solución defectuosa o subóptima, pero ejecutar muchos intentos en paralelo y seleccionar el mejor, ya sea mediante pruebas automatizadas, un modelo de puntuación o revisión humana, aumenta de forma significativa la probabilidad de que al menos un resultado sea realmente bueno.
Lo que hace que este enfoque sea ahora práctico, y no meramente teórico, es la fuerte caída de los costos de inferencia en todo el sector de la IA durante los últimos años. Ejecutar veinte agentes en paralelo sobre la misma tarea resultaba prohibitivamente caro cuando los costos de API por token eran mucho más altos. A medida que los costos han bajado y la competencia entre proveedores de modelos se ha intensificado, la economía de resolver un problema a base de fuerza bruta con muchos intentos paralelos se ha vuelto viable para una gama mucho más amplia de casos de uso.
Este cambio tiene implicaciones reales en cómo se fijan los precios y se usan las herramientas de programación con IA. En lugar de pagar por una única instrucción cuidadosamente elaborada dirigida a un modelo de primer nivel, algunos flujos de trabajo ahora prefieren repartir el mismo presupuesto entre muchas llamadas a modelos más baratos y rápidos ejecutadas en paralelo, bajo la premisa de que la cantidad, combinada con un buen mecanismo de selección, puede superar a un único intento costoso, al menos para ciertas categorías de tareas.
El enfoque no está exento de compensaciones. Ejecutar muchos agentes en paralelo multiplica los costos de cómputo respecto a una única llamada, incluso si cada llamada individual es barata, y el costo agregado puede seguir siendo considerable para tareas complejas y de larga duración. También introduce nuevos desafíos de ingeniería en torno a cómo puntuar, fusionar o seleccionar de manera fiable entre muchos resultados divergentes, un problema nada trivial en sí mismo, en particular para tareas de programación donde la corrección no siempre resulta evidente con una lectura superficial del código.
Los defensores argumentan que los enjambres de agentes son especialmente adecuados para tareas con un criterio de éxito claro y automatizable, como código que debe superar una suite de pruebas específica, ya que la verificación automatizada elimina buena parte de la dificultad de elegir entre resultados en competencia. Las tareas más subjetivas o dependientes del juicio, como decisiones arquitectónicas más amplias, siguen siendo más difíciles de paralelizar eficazmente con este enfoque.
Los críticos del enfoque de enjambre advierten de que esta estrategia puede enmascarar las debilidades subyacentes de un modelo en lugar de resolverlas, ya que lanzar más intentos paralelos sobre un problema con el que un modelo tiene dificultades fundamentales puede acabar produciendo una respuesta aceptable por puro volumen, sin mejorar de forma significativa la capacidad o el razonamiento real del modelo. Algunos ingenieros sostienen que esto corre el riesgo de fomentar una mentalidad de fuerza bruta que sustituye el gasto computacional por mejoras genuinas en la calidad del modelo.
La tendencia más amplia refleja un cambio en cómo las empresas de IA y los desarrolladores conciben la unidad de competencia. En lugar de optimizar únicamente la inteligencia o la precisión de una única llamada al modelo, los enfoques de enjambre de agentes optimizan la economía de todo un proceso, tratando las llamadas individuales al modelo como un recurso barato y desechable que se despliega en masa, en lugar de un recurso valioso y cuidadosamente racionado.
A medida que los costos de inferencia siguen bajando y las herramientas de programación compiten de forma más agresiva tanto en velocidad como en precio, es probable que los enjambres de agentes se conviertan en un patrón arquitectónico cada vez más común en el panorama de herramientas de IA, no tanto porque un agente individual se haya vuelto dramáticamente más inteligente, sino porque ejecutar decenas de ellos en paralelo se ha vuelto lo bastante barato como para merecer la pena.
Para seguir leyendo

AliExpress recibe una multa récord de 625 millones de dólares de la UE por juguetes y cosméticos peligrosos
La Unión Europea ha impuesto a AliExpress una multa récord de 625 millones de dólares en virtud de su Ley de Servicios Digitales, después de que el mercado en línea no retirara anuncios de juguetes inseguros y cosméticos peligrosos pese a advertencias reiteradas. La empresa afirma estar sorprendida por la magnitud de la sanción.

SpaceX en tu fondo indexado, explicado
Los fondos indexados se comercializan como una de las formas más seguras y pasivas de invertir, al repartir el riesgo entre todo el mercado en lugar de apostar por empresas individuales. Mientras SpaceX avanza hacia una cotización bursátil con una valoración de aproximadamente 1,77 billones de dólares, los inversores comunes en fondos indexados podrían acabar poseyendo una parte de ella, lo quieran o no.

Por qué Google está desarrollando su propio chip de IA, y qué significaría para Gemini
La matriz de Google, Alphabet, estaría desarrollando un nuevo chip destinado a hacer que sus modelos de IA Gemini funcionen de forma mucho más eficiente. Esto es lo que hace que los chips personalizados importen tanto a las empresas de IA en este momento, y lo que un Gemini más eficiente podría significar en costos y capacidad.

El histórico acuerdo de 1.500 millones de dólares de Anthropic por derechos de autor recibe la aprobación final
Un tribunal estadounidense ha dado la aprobación final al acuerdo de 1.500 millones de dólares de Anthropic por el uso de libros protegidos por derechos de autor para entrenar sus modelos de IA, cerrando uno de los casos legales más seguidos del sector. El acuerdo resuelve esta disputa concreta, pero deja sin resolver la cuestión más amplia del entrenamiento de IA y el derecho de autor.

Qué le enseñó vender 2.500 grabadores MIDI a un ingeniero sobre las startups de hardware
Un ingeniero compartió las lecciones aprendidas tras vender 2.500 unidades de un pequeño dispositivo de grabación MIDI que diseñó él mismo. La experiencia ilustra en qué se diferencia radicalmente montar un negocio de hardware del software, y por qué a menudo resulta más accesible de lo que se supone.