A China Mobile abriu o código do Open-RAIL, software criado para reduzir o descompasso entre os modelos de inteligência artificial que comandam robôs e os motores responsáveis pelos movimentos. A proposta é evitar que os humanoides parem ou avancem aos trancos enquanto aguardam novos comandos.
Modelos de visão-linguagem-ação, conhecidos pela sigla VLA, observam o ambiente, processam as informações e produzem um action chunk, uma sequência curta de movimentos planejados. Sistemas como o GR00T, da Nvidia, e o π0, da Physical Intelligence, fazem esse processamento cerca de cinco a dez vezes por segundo. Os motores, porém, precisam receber novos comandos de 200 a 1.000 vezes por segundo.
Essa diferença pode deixar a execução travada. Os robôs precisam integrar dados de vídeo, LIDAR e áudio, além de controlar o corpo e se conectar a um sistema central de gerenciamento. Como os VLAs são redes neurais grandes, o processamento pode levar tempo mesmo com chips avançados. A solução mais comum tem sido reduzir a velocidade das demonstrações, em um fator de 4 a 8, para disfarçar os tremores.
Como funciona o Open-RAIL
O software divide o movimento em três processos independentes: observação a 30 Hz, inferência do modelo a 5-10 Hz e controle dos motores de 200 Hz a 1 kHz. Enquanto o robô executa um conjunto de movimentos, o modelo já calcula o próximo. Uma rotina de suavização refina a execução em duas etapas: primeiro dentro de cada conjunto e depois nas transições entre eles.
De acordo com os pesquisadores da China Mobile, o método reduziu os trancos em 100 vezes, mais do que dobrou a velocidade do robô e elevou as taxas de sucesso das tarefas de 10% a 73%. A equipe ressalta que esses números são próprios, e o site do projeto não apresenta os resultados detalhados tarefa por tarefa.
O Open-RAIL é uma camada de implementação, e não apenas um algoritmo. O pacote inclui um sistema servidor-cliente, um painel de controle na web com mais de 40 parâmetros de execução, gravação automática de dados no formato do LeRobot e teleoperação com humano no circuito. Esse recurso permite que um operador corrija o robô durante uma tarefa e incorpore a intervenção aos dados de treinamento.
Modelos e robôs compatíveis
Segundo a equipe, integrar um novo modelo exige de 50 a 100 linhas de código. Uma camada de abstração de hardware foi criada para, teoricamente, reduzir a integração de um novo robô de semanas para horas.
Entre os modelos compatíveis estão o Nvidia GR00T, o π0 e o π0.5, da Physical Intelligence, além de ACT, RDT, SmolVLA, GO-1, da AgiBot, e TAO, da China Mobile. A lista de robôs inclui o AgiBot G1, o WA2, da NAVIAI, e o Lingxi, da China Mobile. O site do projeto também relaciona o G1, da Unitree.
A China Mobile não é a única empresa a trabalhar em soluções para esse descompasso. A Physical Intelligence publicou seu método de chunking em tempo real em 2025, incorporado pela Hugging Face ao framework aberto LeRobot. O artigo do Open-RAIL também compara a proposta com métodos acadêmicos como A2C2 e VLASH. Com o código aberto e a disponibilidade gratuita, o software pode ser avaliado em novas implementações.



