Una sola red, dos tipos de token

Reka AI publicó Rho-1 el 5 de octubre como vista previa de investigación. Es un modelo de 19.000 millones de parámetros que recibe y produce texto, imágenes, vídeo y acciones de robot dentro de una única red, en lugar de derivar cada tarea a un sistema especializado detrás de una interfaz común.

El diseño que describe Reka es deliberadamente simétrico: todo lo que entra o sale de la red adopta uno de dos formatos. El texto y el razonamiento son tokens discretos. Las imágenes, el vídeo, las acciones del robot y la propiocepción —el sentido que tiene un robot de dónde están sus articulaciones— son tokens continuos. Los mismos pesos que predicen el siguiente fotograma producen la siguiente acción de un brazo robótico.

Los datos de entrenamiento robótico son el cuello de botella habitual en este terreno, porque grabar material teleoperado es caro. La respuesta de Reka es un modelo de dinámica inversa que recupera señales de control a partir de vídeo corriente de internet, lo que convierte un corpus grande y barato en algo de lo que puede aprender un modelo de acción.

Una cámara de vídeo profesional sobre un trípode en un estudio
Reka dice que recupera señales de control de robots a partir de vídeo corriente de internet. Ilustración. Caleb Oquendo · pexels · Pexels License

Lo que hace y lo que todavía no hace

Reka publicó cifras de rendimiento más que puntuaciones de referencia. El modelo base genera vídeo a una mediana de 0,79 veces el tiempo real, con unos seis segundos hasta el primer fotograma. Una variante destilada reduce el proceso de eliminación de ruido de 99 pasos a ocho. Las ediciones solicitadas sobre un vídeo en marcha tardan entre 1,11 y 2,01 segundos. La resolución nativa es de 672 por 384.

La empresa es inusualmente directa sobre los límites. La estructura se desvía en secuencias de más de unos 30 segundos. El anclaje temporal es débil, de modo que el modelo pierde el rastro de los objetos a lo largo de un vídeo. La edición visual dirigida es frágil. La resolución nativa queda por debajo de la de los sistemas de vídeo especializados. Ninguna de estas cifras ha sido verificada fuera de Reka.

Un estudio fotográfico vacío con trípodes de iluminación
La resolución nativa de vídeo es de 672 por 384, por debajo de los sistemas especializados. Ilustración. Hc Digital · pexels · Pexels License

La cifra de cómputo es el argumento

Rho-1 se entrenó con 320 GPU Nvidia H100 durante unos tres meses. Es una fracción pequeña de lo que consume un modelo de texto de frontera, y es la parte del anuncio dirigida a quien deba decidir si las arquitecturas multimodales unificadas son una curiosidad de investigación o una opción práctica.

Reka no publica los pesos. El acceso es una vista previa de investigación, y la empresa ha pedido que quien trabaje en robótica encarnada, simulación interactiva o sistemas de visión y acción se ponga en contacto directamente.

La prueba útil será si la tesis de la red única sobrevive al contacto con un robot real. Un modelo que mueve un brazo con los mismos pesos con los que renderiza un vídeo es una idea limpia; si resulta mejor que una pila de modelos especializados conectados entre sí es algo que la vista previa no responde.