Pasamos mucho tiempo haciéndonos una pregunta: ¿cuál es el modelo de IA más inteligente?

¿GPT? ¿Claude? ¿DeepSeek? ¿MiniMax?

Pero después de experimentar con Mixture of Agents (MoA) de Hermes Agent, empecé a preguntarme si esa es la pregunta equivocada.

¿Qué pasaría si, en lugar de elegir un solo modelo de IA, pudieras hacer que varios modelos analicen el mismo problema y dejar que otro modelo combine sus mejores ideas?

En otras palabras:

3 Modelos de IA → 1 Decisión más Inteligente → Mejores Resultados

Esa es la idea detrás de Mixture of Agents. Y decidí ponerla a prueba.

¿Qué es Mixture of Agents?

La mayoría de los agentes de IA trabajan con un solo modelo. Envías un prompt, el modelo razona, usa herramientas y te da una respuesta.

Mixture of Agents introduce una capa adicional. Tu prompt se envía primero a múltiples modelos de referencia en paralelo. Cada modelo analiza el mismo problema de forma independiente y aporta su perspectiva. Luego, sus respuestas se entregan a un modelo agregador, que revisa los diferentes enfoques, combina las ideas más sólidas y decide qué hacer a continuación.

Los modelos de referencia actúan como asesores. El agregador es quien toma las decisiones.

Solo el agregador puede:

  • 📂 Leer archivos
  • 🛠️ Ejecutar herramientas
  • 💻 Correr comandos en terminal
  • ✍️ Modificar código
  • ✅ Producir la respuesta final

Desde tu perspectiva, sigues trabajando con un solo agente de IA. Pero detrás de escena, ese agente está consultando múltiples modelos antes de tomar decisiones importantes.

“El objetivo de Mixture of Agents no es simplemente añadir más modelos. Es darle al modelo final acceso a perspectivas diversas antes de comprometerse con una solución.”

Piensa en Esto como Preguntar a Varios Ingenieros Senior

Imagina que estás tomando una decisión importante de arquitectura. ¿Prefieres preguntarle a un solo ingeniero senior? ¿O tener a tres ingenieros senior revisando el problema primero?

Uno podría detectar de inmediato un problema de seguridad. Otro podría cuestionar si la arquitectura escalará. El tercero podría encontrar una implementación mucho más simple.

Ninguno tiene necesariamente la respuesta completa. Pero un tomador de decisiones que puede ver las tres perspectivas tiene más información antes de elegir un camino.

Los LLMs funcionan de manera similar. Diferentes modelos tienen diferentes fortalezas, debilidades, sesgos y patrones de razonamiento.

Cómo Funciona la Arquitectura

El flujo de trabajo básico se ve así:

                TU PROMPT

          ┌──────────┼──────────┐
          ▼          ▼          ▼
     Modelo IA   Modelo IA   Modelo IA
     Asesor      Asesor      Asesor
          │          │          │
          └──────────┼──────────┘

            Modelo Agregador

               Toma Decisión


         Llamadas a Herramientas + Respuesta Final

La distinción importante: los modelos de referencia asesoran. El agregador actúa. Los asesores no modifican tu proyecto ni ejecutan herramientas. Analizan el problema de forma independiente y proporcionan perspectivas adicionales que el agregador puede usar al decidir qué hacer.

Poniendo a 3 Modelos de IA a Trabajar

Para mi experimento, configuré:

  • DeepSeek V4 Flash — Modelo de referencia
  • 🚀 MiniMax M2.7 — Modelo de referencia
  • 🧠 GPT-5.4 — Modelo agregador

Luego le di al agente una tarea práctica:

“Construye un tablero Kanban para un creador de contenido en YouTube.”

Cuando envié el prompt usando /moa, Hermes envió el mismo problema a ambos modelos de referencia en paralelo. Cada uno analizó la tarea de forma independiente. Una vez que sus respuestas estuvieron listas, el agregador recibió: mi prompt original + la perspectiva de DeepSeek + la perspectiva de MiniMax.

El resultado fue sorprendente.

Después de aproximadamente 14 minutos, el agente había construido una aplicación Kanban funcional de una sola página con:

  • 📋 Siete columnas enfocadas en flujo de trabajo del creador
  • 📝 Tarjetas de tareas editables
  • 🏷️ Etiquetas y prioridades
  • 📅 Fechas de vencimiento
  • ☑️ Listas de verificación
  • 🔍 Búsqueda
  • 🎛️ Filtros
  • 🖱️ Tarjetas con arrastrar y soltar (drag-and-drop)
  • 📊 Estadísticas del flujo de trabajo
  • 💾 Persistencia local en el navegador

Todo desde un solo prompt inicial.

Cómo Diferentes Modelos Abordan el Mismo Problema

Una de las partes más interesantes de la implementación de Hermes Agent es la visibilidad de lo que están haciendo los modelos de referencia. Mientras la tarea se ejecuta, puedes ver cada modelo de referencia analizando el problema de forma independiente.

Esto permite observar:

  • 🧠 Qué notan los diferentes modelos
  • 🔍 Detalles que un modelo capta y otro pasa por alto
  • 💡 Diferentes enfoques para el mismo problema
  • 🤝 Cómo esas perspectivas informan al agregador

“No necesitas necesariamente que tres modelos estén de acuerdo. A veces el desacuerdo es la parte útil.”

Es un recordatorio útil de que diferentes LLMs no siempre abordan los problemas exactamente de la misma manera. Y de ahí proviene el valor potencial de Mixture of Agents.

Una Configuración que Marca una Gran Diferencia

Hay un ajuste que vale la pena entender: reference_max_tokens. Controla cuánto output puede generar cada modelo de referencia para el agregador.

Darle a cada asesor miles de tokens no es necesariamente útil. El agregador a menudo necesita las ideas clave, no otra solución completa. Límites más bajos pueden significar:

  • ⚡ Respuestas más rápidas
  • 💰 Menor uso de tokens
  • 🎯 Consejos más enfocados
  • 📉 Menos contexto innecesario para el agregador

Hermes recomienda 600 tokens como valor práctico por defecto para respuestas de referencia concisas, aunque el valor ideal dependerá de tu tarea.

Diferentes Equipos de IA para Diferentes Problemas

Otra característica útil es la capacidad de crear múltiples presets de Mixture of Agents. No necesitas un equipo universal de IA. Puedes tener:

  • 💻 Programación: Modelos seleccionados específicamente para ingeniería de software
  • 🔬 Investigación: Modelos con diferentes fortalezas en análisis y razonamiento de contexto largo
  • 🏗️ Arquitectura: Modelos que proporcionan perspectivas complementarias sobre diseño de sistemas
  • 📈 Análisis Financiero: Una combinación completamente diferente optimizada para tareas analíticas

En lugar de preguntar constantemente “¿cuál es el mejor modelo de IA?”, la pregunta más interesante se convierte en: “¿Cuál es la mejor combinación de modelos para este problema en particular?”

¿Cuándo Ayuda Realmente Mixture of Agents?

No activaría Mixture of Agents para cada prompt. Si preguntas “¿cuánto es 15 × 27?”, tres modelos de IA no van a hacer la respuesta tres veces mejor.

El razonamiento adicional se vuelve valioso cuando hay múltiples enfoques válidos para un problema. Algunos buenos candidatos:

  • 🏗️ Arquitectura de software
  • 🔍 Revisiones de código (code reviews)
  • 🐞 Depuración compleja
  • 📚 Investigación técnica
  • 🔄 Planificación de migraciones
  • ⚙️ Diseño de sistemas
  • 🤖 Flujos de trabajo con agentes de IA

Estos son problemas donde una segunda o tercera perspectiva puede exponer algo que el primer modelo pasó por alto.

Las Compensaciones

Mixture of Agents no es una mejora de inteligencia gratuita.

💰 Costos de API más altos: Estás haciendo llamadas adicionales a modelos. Con dos modelos de referencia y un agregador, estás pagando por múltiples perspectivas. Hermes preserva el prompt caching, lo que ayuda, pero las llamadas adicionales siguen introduciendo costo extra.

⏳ Mayor latencia: El agregador necesita los outputs de referencia antes de usarlos. Las tareas complejas pueden tomar más tiempo que simplemente enviar todo directamente a un modelo.

🤔 Más modelos ≠ Mejores resultados: Añadir modelos a ciegas no es la meta. Si todos tus modelos de referencia tienen fortalezas similares y abordan los problemas de forma parecida, las perspectivas adicionales pueden no aportar mucho. El valor real viene de la diversidad.

“Una buena combinación puede incluir modelos que se destacan en diferentes áreas, en lugar de simplemente elegir los tres modelos con mayor puntuación en un leaderboard.”

La Idea Principal: Los Modelos de IA No Tienen que Competir

La conclusión más interesante para mí no fue la aplicación Kanban en sí. Fue el cambio en cómo podemos pensar sobre los modelos de IA.

La mayor parte de la conversación en la industria gira en torno a la competencia: ¿qué modelo es el #1? ¿qué modelo tiene la puntuación más alta? ¿qué modelo debería reemplazar al que uso actualmente?

Pero quizás eso es solo parte de la historia.

El siguiente paso en los sistemas de IA podría no ser simplemente un modelo más inteligente. Podría ser también: múltiples modelos especializados trabajando juntos.

En lugar de elegir entre Claude, DeepSeek, MiniMax, GPT o lo que venga después, los agentes de IA pueden usar diferentes modelos como un equipo, aprovechando sus fortalezas individuales antes de tomar una decisión final.

La pregunta entonces cambia de “¿qué modelo de IA es el más inteligente?” a “¿qué combinación de modelos de IA toma las decisiones más inteligentes?”

Y creo que ese es un problema mucho más interesante.


Sigue explorando estos temas en el blog de DojoFullStack. La combinación de modelos de IA, agentes autónomos y automatización está redefiniendo cómo construimos software — y apenas estamos empezando.