← Volver al blog
Aiaprox. 8 min de lectura

Ai2 publicó como código abierto el stack de entrenamiento, no otro conjunto de pesos

Publicado 5 oct 2026
Ai2 publicó como código abierto el stack de entrenamiento, no otro conjunto de pesos

El Allen Institute for AI publicó Olmo-core 3, una infraestructura de entrenamiento abierta para modelos de mezcla de expertos a escala de billones de parámetros. El benchmark principal es un MoE de 47 mil millones de parámetros que alcanza aproximadamente 2,7 veces el rendimiento de la configuración anterior en ocho GPU B300. Esa cifra es respetable. Tampoco es la razón por la que este lanzamiento importa.

Los pesos son fáciles de regalar y difíciles de aprender de ellos. Descargas un conjunto de pesos y puedes ejecutar un modelo. No puedes reproducirlo, auditarlo ni reentrenarlo con tus propios datos sin, en esencia, reconstruir desde cero el pipeline de entrenamiento. Olmo-core 3 es la publicación de ese pipeline.

La distinción que no deja de aparecer

Los pesos abiertos y el entrenamiento abierto son productos distintos, y la brecha entre ellos es donde reside la mayor parte de la información útil.

Un modelo publicado te dice qué logró un equipo. Un stack de entrenamiento te dice cómo, que es lo que necesitas si quieres hacerlo tú mismo. El segundo es mucho más útil para cualquiera fuera de la organización que lo publica, y mucho más raro, porque el código de entrenamiento, el pipeline de datos y los detalles de configuración son las partes que más tiempo tomaron en quedar bien.

La mezcla de expertos hace que esto sea más importante, no menos. Un modelo MoE enruta cada token a un subconjunto de expertos, así que un modelo con billones de parámetros totales podría activar una pequeña fracción por token. Ese diseño reduce el coste de inferencia, pero introduce decisiones de enrutamiento, balanceo de carga entre expertos y patrones de comunicación entre dispositivos que son genuinamente difíciles de ajustar. Dos equipos pueden tener arquitecturas de modelo idénticas y rendimientos muy distintos debido a decisiones en el bucle de entrenamiento.

Publicar la infraestructura de entrenamiento significa que esas decisiones son visibles. Eso es lo que hace significativa una cifra de rendimiento de 2,7 veces, porque está ligada a código que otra persona puede ejecutar y verificar.

Una placa aceleradora gráfica tumbada sobre una mesa oscura junto a una ficha en blanco

Por qué el entrenamiento de MoE es la parte difícil

Los modelos densos escalan de forma predecible. Añades parámetros, añades cómputo y obtienes una curva suave. Los modelos MoE introducen un problema de planificación. Si el enrutador envía la mayoría de los tokens a unos pocos expertos, esos expertos se convierten en el cuello de botella y el resto del hardware queda inactivo. Si reparte los tokens de forma demasiado uniforme, el modelo pierde la especialización que hacía atractiva la arquitectura.

Hacer esto bien requiere factores de capacidad, pérdidas auxiliares y superposiciones de comunicación que la mayoría de los laboratorios considera propiedad exclusiva. También requiere checkpointing que sobreviva a fallos de hardware, porque una ejecución de entrenamiento a esta escala sufrirá fallos y reiniciar desde el principio no es una opción.

La mejora de rendimiento que Ai2 reporta en ocho GPU B300 es un resultado a pequeña escala, y debe leerse como tal. Demostrar que un bucle de entrenamiento es eficiente en un nodo no es lo mismo que demostrar que se mantiene en cientos de nodos, donde domina la comunicación entre nodos. Pero es el primer resultado correcto, porque los problemas de eficiencia suelen aparecer primero a pequeña escala y empeoran a medida que escalas.

Por qué el rendimiento en ocho GPU es el primer número correcto

Un resultado de rendimiento a pequeña escala parece modesto junto al encuadre de billones de parámetros, y merece una defensa. Los problemas de eficiencia de entrenamiento tienden a aparecer temprano y empeorar. Si un bucle de entrenamiento desperdicia un tercio de su cómputo en un solo nodo, el mismo bucle desperdiciará más cuando se añada la comunicación entre nodos, porque la ineficiencia se acumula con cada capa de coordinación.

Publicar primero un número a pequeña escala es una forma de decir que los fundamentos son sólidos antes de hacer afirmaciones sobre un clúster grande. También es el lugar correcto para empezar. Un equipo que reporta un número a gran escala antes que uno pequeño normalmente está reportando un pico en lugar de una tasa sostenida.

Hay una segunda razón por la que la cifra importa. El rendimiento de MoE es sensible al tamaño de lote y a la longitud de secuencia de formas en que los modelos densos no lo son, y la configuración que maximiza la eficiencia en ocho GPU a menudo se generaliza a clústeres más grandes con ajuste. Una mejora de 2,7 veces es lo bastante grande como para reflejar un cambio estructural en lugar de un detalle de ajuste, lo que la hace digna de atención.

La audiencia para esto es más pequeña que la audiencia para los pesos

La mayoría de las personas que hablan de modelos abiertos quieren pesos. Quieren ejecutar inferencia, hacer fine-tuning en un dominio o construir un producto. Ese grupo está atendido por cada publicación de pesos abiertos.

El grupo que necesita un stack de entrenamiento es mucho más pequeño: laboratorios de investigación, programas nacionales de cómputo, universidades con acceso a clústeres y empresas de industrias reguladas que deben documentar cómo se produjo un modelo. Esos usuarios han estado mal atendidos, porque la elección ha sido entre construir un pipeline desde cero y usar algo que solo funciona con el hardware de un proveedor específico.

Un stack de entrenamiento abierto cambia la segunda opción. Le da a un laboratorio un punto de partida que puede modificar, y le da a un programa gubernamental un camino hacia modelos soberanos que no depende de la disposición de un proveedor extranjero a compartir detalles de implementación.

Eso es algo estratégico de publicar, y Ai2 ha sido consistente al respecto. Los modelos del instituto se han publicado con datos, código y registros de entrenamiento, lo cual es un estándar más exigente que publicar pesos y un artículo.

La discusión silenciosa sobre el entrenamiento abierto

Hay un debate dentro de la comunidad de modelos abiertos sobre qué debería significar la apertura, y publicaciones como esta lo impulsan.

Una postura sostiene que los pesos son lo que importa, porque los pesos son lo que la gente usa. Bajo esa visión, publicar un modelo es un regalo y los detalles de entrenamiento son asunto privado de una empresa. La otra postura sostiene que un modelo sin su stack de entrenamiento no puede ser auditado, reproducido ni mejorado por nadie fuera del equipo original, y que llamar abierta a una publicación así exagera lo que ofrece.

La segunda postura ha ido ganando terreno por una razón práctica. Los reguladores de varias jurisdicciones han empezado a pedir a los desarrolladores de modelos que documenten los datos de entrenamiento y su procedencia. Un equipo que entrenó con un pipeline publicado puede responder esas preguntas. Un equipo que hizo fine-tuning con pesos prestados no puede, porque no sabe qué se usó para producirlos.

Para un instituto de investigación, el cálculo es simple. Publicar un stack cuesta tiempo de ingeniería y no cede nada comercialmente, porque el instituto no vende llamadas a API. Para un laboratorio comercial, hacer lo mismo les daría a los competidores una ventaja inicial. Esa asimetría es la razón por la que los stacks de entrenamiento abiertos provienen de institutos y universidades mucho más a menudo que de empresas, y por la que cada uno que aparece vale la pena examinar.

Qué observar

Si el resultado de rendimiento se mantiene a escala. La prueba interesante no son ocho GPU, sino unos pocos cientos, donde los patrones de comunicación que Olmo-core 3 codifica funcionan o no.

Si los laboratorios externos realmente lo adoptan. Un stack de entrenamiento se difunde cuando alguien más entrena un modelo con él y publica el resultado. La primera reproducción creíble sería más informativa que cualquier tabla de benchmarks.

Si el entrenamiento abierto cambia las adquisiciones. Las organizaciones que necesitan documentar la procedencia de sus modelos han tenido opciones limitadas. Si un pipeline de entrenamiento completo está disponible bajo una licencia permisiva, algunas de esas organizaciones construirán sobre él en lugar de pagar por una alternativa cerrada.

Las publicaciones de pesos reciben la atención porque cualquiera puede descargarlas y probarlas. Las publicaciones de entrenamiento son donde se transfiere el conocimiento real del campo, y ocurren con mucha menos frecuencia. Esta vale la pena leerla de cerca, ya que la parte transferible de un modelo es el proceso que hay detrás.

Artículos relacionados