Figure AI consiguió que su robot humanoide, Figure 03, pasara del 9% al 56% de éxito en una serie de tareas domésticas tras incorporar datos recopilados con Index, la plataforma con la que paga a personas para que se graben realizando actividades cotidianas. Para medir el efecto de esa información, la compañía mantuvo el mismo robot, las mismas tareas y la misma configuración de entrenamiento.
El salto se registró en evaluaciones realizadas con una diferencia de cuatro semanas entre sí. Sin embargo, eso no significa que todo el entrenamiento haya tenido lugar durante ese mes. Figure aclaró que Index ya funcionaba antes de anunciar una inversión de US$ 1.000 millones durante 12 meses para ampliar la recolección de datos, por lo que parte del material utilizado era anterior.
Cómo Figure probó sus robots en casas desconocidas
La empresa alquiló 30 viviendas en el Área de la Bahía de San Francisco y llevó ahí al Figure 03 sin haber recopilado previamente datos en ninguna de ellas. El robot debía ordenar entre 13 y 15 juguetes dispersos, doblar toallas y colocarlas en un canasto, además de hacer la cama, acomodando las almohadas y el acolchado.
La prueba buscaba comprobar si podía adaptarse a entornos y objetos que no habían formado parte de su entrenamiento. Como cada vivienda tenía muebles, superficies y elementos distintos, el humanoide debía aplicar lo aprendido en situaciones nuevas.
Figure realizó 420 intentos y completó correctamente 237, lo que equivale al 56%. El criterio era exigente porque el robot tenía que completar toda la secuencia para que la prueba contara como exitosa. Cualquier intervención humana por motivos de seguridad se consideraba un fallo.
El resultado también marca una diferencia frente a referencias recientes del sector. El AI Index 2026 de Stanford había mostrado en abril que los humanoides podían completar de forma segura alrededor del 12% de las tareas domésticas reales, frente al 89,4% en simulaciones. En BEHAVIOR-1K, otra evaluación basada en 1.000 actividades que las personas querrían delegar a robots, los mejores equipos rondaban el 25%.
Index ya alcanzó 115.000 usuarios semanales y genera alrededor de 55 minutos de nuevas demostraciones humanas por segundo, según datos difundidos por Figure. Esa escala está acompañada por una fuerte inversión en capacidad de procesamiento. La compañía comprometió US$ 3.500 millones en un acuerdo con Nscale que contempla hasta 100.000 GPU Nvidia Vera Rubin.
La apuesta podría ir más allá de fabricar y vender robots propios. Si Figure logra que su sistema permita entrenar distintos tipos de humanoides, podría ofrecer esa tecnología a otros fabricantes y convertir parte de su negocio en una plataforma de IA física. Para eso, todavía deberá demostrar que el modelo puede funcionar a mayor escala.
Los experimentos con Index dejaron, además, otro dato a tener en cuenta. Figure entrenó cuatro modelos con diferentes cantidades de información y encontró una relación bastante regular entre el volumen de datos utilizado y el rendimiento posterior.

En términos simples, la compañía empieza a estimar cuánto podría mejorar un robot a medida que suma nuevas demostraciones humanas. Si esa relación se mantiene, también podría calcular con mayor precisión cuántos datos necesita y cuánto tendría que invertir para alcanzar un nivel determinado de desempeño.
La carrera por encontrar la mejor forma de enseñarles
Figure no es la única compañía que utiliza movimientos humanos para entrenar robots. Reward AI presentó OM-1, un sistema desarrollado a partir de datos recopilados de personas mediante un dispositivo que registra los movimientos de la mano. XPENG, por su parte, combina videos de humanos con errores simulados para entrenar a su humanoide IRON.
Otras empresas desarrollaron equipos específicos para recopilar esos movimientos. Sunday Robotics utiliza guantes de captura para entrenar a su robot Memo, mientras que X Square creó un dispositivo portátil de tres dedos que, según la compañía, permite recolectar datos 5,3 veces más rápido que mediante la operación remota de un robot.
Dentro de la industria también existe una discusión sobre cuánto entrenamiento debe realizarse con información obtenida en el mundo real y cuánto puede trasladarse a simulaciones. Apptronik construyó una fábrica de datos para humanoides de más de 8.000 metros cuadrados y Shift ofrece limpiar viviendas a cambio de poder registrar las tareas. Antioch, en cambio, recaudó US$ 32 millones con una propuesta que busca reducir la cantidad de datos físicos necesarios mediante un mayor uso de simulaciones.
Figure se diferencia por priorizar la escala. En lugar de depender de dispositivos especializados para obtener demostraciones más precisas, busca reunir una enorme cantidad de ejemplos realizados por personas y comprobar si ese volumen es suficiente para mejorar el rendimiento de sus robots.
El resultado del 56% de todos modos todavía deja margen para mejorar. Tony Zhao, CEO de Sunday Robotics, cuestionó si un robot puede considerarse confiable cuando falla en casi la mitad de las pruebas. Su compañía logró doblar correctamente 778 prendas sobre un total de 785 intentos, una tasa de éxito del 99,1%, en pruebas con nueve tipos de prendas y en entornos desconocidos.
Los porcentajes, sin embargo, miden cosas distintas. Sunday contabiliza cada prenda doblada de manera individual, mientras que Figure evalúa una tarea completa y considera fallido todo el intento si el robot comete un error durante la secuencia. Al separar sus resultados por actividad, Figure obtuvo un 67% de éxito al hacer camas, un 62% con las toallas y un 40% al ordenar juguetes.
Otra incógnita es la velocidad. Figure no informó cuánto tardaron en promedio sus robots, aunque la evaluación permitía hasta un minuto por juguete y tres minutos por toalla. Reward AI, en cambio, aseguró que su sistema OM-1 puede realizar las tareas a una velocidad comparable a la de una persona. El tiempo necesario para completar cada tarea será un factor importante si estos humanoides buscan utilizarse a diario en una casa.
También hay que considerar las condiciones de las pruebas. Las 30 viviendas eran alquileres temporarios, con ambientes generalmente más ordenados que los de una casa habitada de manera permanente. No había mascotas, acumulaciones de ropa ni chicos pequeños moviendo objetos mientras el robot trabajaba.
El próximo paso será comprobar si Figure puede mantener la mejora a medida que amplía Index y, sobre todo, reducir el número de fallos hasta alcanzar un nivel de confiabilidad compatible con el uso doméstico.
*Esta nota fue publicada originalmente en Forbes.com.