AI News

NVIDIA está presentando un nuevo argumento en la carrera por los agentes de IA empresariales: una mejor ingeniería de sistemas alrededor de un modelo puede importar tanto como, o más que, entrenar un modelo más grande. En un par de publicaciones corporativas, NVIDIA dijo que LangChain ajustó su harness Deep Agents para NVIDIA Nemotron 3 Ultra y que, en el propio benchmark de LangChain, llevó al modelo abierto a lo que NVIDIA describe como un rendimiento líder entre los modelos abiertos y a la paridad en tareas de negocio con los modelos cerrados con mayor puntuación.

El anuncio importa porque desplaza la atención de los lanzamientos puros de modelos a la capa de software que los envuelve: prompts, descripciones de herramientas, middleware, memoria y bucles de evaluación. Según NVIDIA, esos cambios permiten a los equipos usar una pila abierta en lugar de depender solo de costosos modelos propietarios de frontera para flujos de trabajo de agentes. Para constructores y compradores empresariales, el mensaje práctico es que la calidad de los agentes puede ganarse cada vez más mediante el ajuste del harness y los controles de ejecución, no solo seleccionando el endpoint de modelo más potente.

Lo que NVIDIA y LangChain anunciaron realmente

La noticia principal no es un nuevo modelo base. En su lugar, NVIDIA y LangChain están poniendo a disposición un perfil ajustado de LangChain Deep Agents para NVIDIA Nemotron 3 Ultra, junto con lo que NVIDIA llama el blueprint NVIDIA NemoClaw para LangChain Deep Agents. NVIDIA afirma que esto empaqueta el harness ajustado con NVIDIA OpenShell, un runtime seguro diseñado para ejecutar acciones de agentes de forma más segura dentro de entornos empresariales.

Según NVIDIA, el perfil ajustado está disponible directamente a través de LangChain, y los desarrolladores también pueden usar el blueprint NemoClaw como punto de partida para construir agentes especializados. NVIDIA añadió además que los desarrolladores pueden acceder a NVIDIA Nemotron 3 Ultra mediante proveedores alojados como Baseten, Crusoe Cloud, DeepInfra, Fireworks, Nebius y Together AI.

El énfasis en ambas publicaciones de origen es que las mejoras se lograron sin reentrenar el modelo. NVIDIA dice que LangChain ejecutó el modelo frente a su suite pública de benchmark Deep Agents, examinó las trazas de ejecución donde el sistema perdía puntos y luego ajustó el harness alrededor del modelo en lugar de cambiar los pesos. Esa distinción es central para la propuesta de NVIDIA: los modelos abiertos pueden mejorar de forma material mediante ingeniería específica del flujo de trabajo, manteniendo amplias las opciones de despliegue.

Harrison Chase, CEO de LangChain, citado en el blog de NVIDIA, presentó el trabajo como evidencia de que las empresas pueden obtener un gran rendimiento de una pila abierta al tiempo que conservan el control sobre sus sistemas de agentes. Ese comentario ejecutivo procede de una fuente controlada por un proveedor, pero encaja con los detalles de implementación del tutorial para desarrolladores de NVIDIA.

Por qué importa el cambio técnico

El detalle más útil proviene del NVIDIA Developer Blog, que explica qué significó en la práctica el “harness tuning”. La publicación describe un bucle repetible: ejecutar un benchmark de evaluación, inspeccionar fallos, proponer cambios de perfil, verificar correcciones y volver a ejecutar la suite para comprobar regresiones. El blog dice que los perfiles de harness de LangChain ofrecen a los desarrolladores un lugar formal para personalizar el comportamiento del modelo para flujos de trabajo de agentes específicos.

En este relato, los cambios no fueron optimizaciones abstractas. Incluyeron ediciones de system prompts, sufijos de prompt y descripciones de herramientas, además de añadidos de middleware diseñados para detectar modos de fallo comunes. El tutorial señala un ejemplo concreto con la herramienta integrada read_file. En una tarea del benchmark, el modelo necesitaba seguir leyendo un archivo paginado para encontrar la última línea no vacía. En cambio, respondió basándose solo en la primera página. La solución propuesta añadió comportamiento de middleware para detectar el truncamiento en la lectura de archivos y ayudar al agente a continuar correctamente.

Ese ejemplo es importante porque refleja el modo de fallo real de muchos agentes de IA: no la falta de fluidez lingüística, sino una interacción débil con herramientas y estados. La mejora de benchmark que NVIDIA está promocionando parece provenir de hacer que NVIDIA Nemotron 3 Ultra se comporte de forma más fiable dentro del entorno de orquestación LangChain Deep Agents, no de convertirlo en un modelo más capaz de forma general.

La publicación para desarrolladores también sostiene que este proceso puede automatizarse parcialmente. Menciona LangSmith Engine y un “ralph loop” como ejemplos de proponentes agénticos que pueden sugerir cambios de harness, verificar pasadas repetidas de pruebas e intentar evitar el sobreajuste. Eso sigue describiéndose en términos de tutorial más que como un lanzamiento de producto, pero apunta a una tendencia más amplia: la optimización de agentes impulsada por evaluación como su propia categoría de software.

Evidencias, benchmarks y lo que sigue siendo informado por el proveedor

Las afirmaciones más fuertes de esta historia provienen de los propios blogs de NVIDIA, por lo que deben tratarse como informadas por el proveedor salvo que se reproduzcan de forma independiente. NVIDIA dice que la configuración ajustada de NVIDIA Nemotron 3 Ultra logró la mayor precisión entre los modelos abiertos en el benchmark Deep Agents de LangChain, completó más tareas con mayor rendimiento y funcionó a una décima parte del coste de inferencia por ejecución de los modelos cerrados líderes. NVIDIA también dice que el modelo alcanzó “paridad en tareas de negocio” con los modelos cerrados con mayor puntuación en ese benchmark.

Son afirmaciones significativas si se sostienen, pero la evidencia disponible en este conjunto de fuentes no ofrece la tabla completa del benchmark, la lista exacta de competidores, las condiciones de ejecución, los supuestos de precios por token ni los intervalos de confianza. La publicación para desarrolladores también señala que el benchmark y las pruebas son estocásticos y deben ejecutarse varias veces. Esa advertencia importa. En evaluaciones de agentes, pequeños cambios en prompts o middleware pueden parecer impresionantes en ejecuciones limitadas y, sin embargo, no generalizarse entre cargas de trabajo.

También es notable que el benchmark sea el propio Deep Agents de LangChain y que el ajuste se haya hecho específicamente para LangChain Deep Agents. Eso no invalida el resultado, pero sí acota su alcance. Los compradores deberían leer esto como evidencia del rendimiento dentro de un entorno concreto de harness y benchmark, no como una afirmación general de que NVIDIA Nemotron 3 Ultra sea universalmente igual a los principales modelos propietarios.

NVIDIA también cita actividad del ecosistema en torno a la pila. Dice que Abridge, Amdocs y Box están integrando agentes especializados en sus plataformas y que EY está ampliando las capacidades de implementación alrededor de los blueprints NVIDIA NemoClaw para LangChain Deep Agents. Sobre la base del material de origen aquí, esas referencias deben entenderse como ejemplos de actividad de socios declarados por el proveedor, no como estudios de caso de despliegue verificados de forma independiente.

Qué significa esto para constructores y compradores empresariales

Para los equipos de producto que construyen agentes, el anuncio refuerza una lección práctica: la elección del modelo es solo una parte de la calidad del agente. Si una organización ya usa LangChain, la disponibilidad de un perfil ajustado para NVIDIA Nemotron 3 Ultra reduce el esfuerzo necesario para probar una vía con modelos abiertos. Eso podría ser atractivo en codificación, flujos de documentos, análisis de datos o tareas operativas donde el agente debe invocar herramientas de forma consistente y donde importa el coste de inferencia.

Para las empresas, el mayor atractivo es el control. NVIDIA está promoviendo explícitamente una pila totalmente abierta compuesta por un modelo abierto, un harness abierto y un runtime seguro. En términos de compras, eso se alinea con preocupaciones familiares: dónde se ejecuta el sistema, quién posee la lógica de orquestación, cómo se gobierna la ejecución de herramientas y si la pila puede personalizarse sin esperar a un proveedor de modelos.

El argumento del coste puede ser especialmente convincente para equipos que quieren ejecutar evaluaciones continuas en lugar de demostraciones ocasionales. Si la cifra de una décima parte del coste se mantiene aproximadamente en despliegues reales, eso cambia con qué frecuencia los equipos pueden probar actualizaciones de agentes, comparar perfiles y especializar flujos de trabajo. El valor no es solo un menor coste de producción; es una iteración más barata. Eso es, a menudo, lo que separa un piloto de un sistema en producción.

Aun así, la pila es más convincente donde los equipos tienen la capacidad de ajustarla y gobernarla. Una configuración abierta con LangChain Deep Agents, NVIDIA Nemotron 3 Ultra y NVIDIA OpenShell puede ofrecer flexibilidad, pero también deja más responsabilidad de implementación en el comprador que una única API propietaria llave en mano. El trabajo de fiabilidad, los límites de seguridad y la disciplina de evaluación no desaparecen solo porque el software esté disponible.

La competencia se está desplazando hacia arriba en la pila

La señal estratégica de este lanzamiento es que la competencia está pasando de los rankings de modelos a la infraestructura de agentes. NVIDIA no solo vende silicio o endpoints aquí; está intentando definir una arquitectura de referencia para agentes de IA empresariales. Al combinar NVIDIA Nemotron 3 Ultra con NVIDIA NemoClaw y su distribución a través de hosts en la nube como Baseten y Together AI, NVIDIA se posiciona como proveedor de plataforma para toda la pila de agentes.

Eso también fortalece el papel de LangChain. El benchmark de la compañía, los perfiles de harness y el entorno de orquestación pasan a formar parte de cómo se mide y mejora la competitividad de los modelos. NVIDIA destacó que LangChain informa de más de 200 millones de descargas mensuales, una cifra citada por NVIDIA a partir de la posición de LangChain en la plataforma. Aunque aquí ese número no esté verificado de forma independiente, el punto general es creíble: la capa de orquestación tiene influencia. Un modelo que por sí solo es apenas adecuado puede volverse materialmente más útil cuando se adapta estrechamente a un harness popular.

Para los proveedores de modelos cerrados, el desafío está claro. Siguen liderando muchos benchmarks amplios de inteligencia, pero las alternativas abiertas se vuelven cada vez más viables cuando se combinan con ingeniería específica de la tarea y runtimes aptos para empresas. Eso no elimina la brecha en todas partes, especialmente en tareas novedosas de razonamiento, pero sí eleva el listón para precios premium en casos de uso de agentes donde predominan las herramientas y el control.

Qué observar a continuación

La siguiente señal a observar es la replicación independiente. Si desarrolladores externos publican sus propios resultados de LangChain Deep Agents para NVIDIA Nemotron 3 Ultra, especialmente en cargas de trabajo fuera de los ejemplos de NVIDIA, aumentará la confianza en las afirmaciones de rendimiento.

Un segundo indicador es si NVIDIA o LangChain publican divulgaciones de benchmark más completas, incluidas las bases exactas, el número de ejecuciones, la varianza y los supuestos de coste frente a competidores cerrados concretos. Sin eso, las afirmaciones de “paridad” y “coste 10 veces menor” seguirán siendo interesantes en términos direccionales, pero difíciles de comparar.

En tercer lugar, conviene observar si integradores de sistemas como EY convierten el blueprint en patrones repetibles de entrega empresarial. Las arquitecturas de referencia importan más cuando se convierten en despliegues listos para compras, con gobernanza, registro y controles de políticas integrados.

Por último, merece la pena seguir si la ingeniería del harness se convierte en una capa de producto normalizada. Herramientas como LangSmith Engine, bucles de ajuste impulsados por benchmarks y bibliotecas de middleware podrían convertirse en partes estándar de las operaciones de agentes, del mismo modo que la observabilidad se volvió estándar en el software en la nube.

Perspectiva de Creati.ai

Este anuncio trata menos de una victoria aislada de un modelo que de dónde se está acumulando el valor en la IA empresarial. NVIDIA y LangChain sostienen que la ventaja duradera en agentes puede venir de la ingeniería del harness, la disciplina de evaluación y la seguridad en tiempo de ejecución, más que de la novedad pura del modelo. Esa tesis encaja con lo que muchos equipos de producción ya ven: el uso de herramientas y la fiabilidad del flujo de trabajo suelen romperse antes que la calidad de la generación de texto.

La advertencia es que casi todas las métricas principales de esta historia provienen de fuentes controladas por el proveedor y de un benchmark vinculado a la misma pila de orquestación que se está promocionando. Aun así, la dirección general del mercado parece creíble. Para los desarrolladores, la conclusión importante no es que NVIDIA Nemotron 3 Ultra haya cerrado definitivamente la brecha con todos los modelos propietarios. Es que los modelos abiertos, junto con una orquestación sólida, ya pueden ser lo bastante competitivos como para merecer una evaluación seria, especialmente para las empresas que se preocupan por el coste, el control y la capacidad de ejecutar agentes de IA bajo sus propias condiciones.

Destacados

NVIDIA y LangChain impulsan Nemotron 3 Ultra con ajuste de harness, argumentando que las pilas abiertas de agentes pueden acercarse a los resultados de los modelos cerrados a menor coste

NVIDIA afirma que Nemotron 3 Ultra ajustado por LangChain alcanzó resultados líderes en benchmarks de modelos abiertos para agentes, destacando pilas abiertas más baratas para la IA empresarial.