Actualités

Figure affirme que Helix 2.5 généralise dans 30 maisons jamais vues — ce que le test montre vraiment

Figure annonce avoir adapté un même modèle Helix 2.5 au rangement, au pliage de serviettes et au lit, puis l’avoir évalué dans 30 maisons sans collecte de données ni fine-tuning dans ces maisons.

Tomorrow, Tested.
CARTE ÉDITORIALE

Le résultat le plus intéressant n’est pas une démo isolée : Figure rapporte 56 % de réussite zero-shot avec préentraînement Index contre 9 % depuis zéro à données downstream comparables. L’évaluation est détaillée, mais reste menée par Figure.

Ce que nous savons

Périmètre

Figure a évalué trois comportements whole-body dans 30 maisons de la Bay Area sans collecte ni adaptation spécifiques dans ces environnements.

Déclaration du fabricant
Tâches

Les trois comportements sont le rangement du salon, le pliage de serviettes et la préparation du lit.

Vérifié
Effet du préentraînement

Figure rapporte 56 % de réussite zero-shot avec préentraînement Index contre 9 % pour un modèle entraîné depuis zéro avec les mêmes données de spécification de tâche.

Déclaration du fabricant
Efficacité des données

Figure affirme que Helix 2.5 atteint le niveau d’un comportement Helix 02 comparable avec moitié moins de données d’adaptation spécifiques à la tâche, tout en généralisant à 30 maisons.

Déclaration du fabricant
Indépendance

Le protocole et les résultats ont été publiés par Figure ; Tomorrow, Tested. n’a pas reproduit indépendamment l’étude dans 30 maisons.

Limite

Le titre important n’est pas « un humanoïde sait faire un lit »

Figure a déjà montré des tâches domestiques. L’affirmation plus intéressante de Helix 2.5 est ailleurs : l’entreprise dit avoir emmené les mêmes comportements dans 30 maisons qui n’avaient pas servi à collecter des données d’entraînement spécifiques, sans fine-tuning après l’arrivée.

Les trois tâches sont le rangement du salon, le pliage de serviettes et la préparation du lit. Elles demandent perception, locomotion, manipulation d’objets rigides et déformables, coordination des deux mains et repositionnement du corps.

C’est un niveau de preuve plus intéressant qu’une démo parfaite dans une seule cuisine.

Ce que « zero-shot » veut dire ici

Le zero-shot concerne les maisons d’évaluation et les objets manipulés.

Figure affirme n’avoir collecté aucune donnée dans ces maisons, ne pas avoir utilisé les jouets, serviettes ou literies de test dans les données spécifiques aux tâches et ne pas avoir adapté les poids du modèle avec les rollouts d’évaluation.

En revanche, les trois tâches ont bien été apprises auparavant avec des données collectées ailleurs.

Ce n’est donc pas « le robot découvre comment faire un lit à partir d’une phrase ». C’est une expérience de généralisation vers de nouveaux environnements et objets.

Le test 56 % contre 9 %

Figure a entraîné deux politiques avec les mêmes données spécifiques aux tâches, en gardant architecture, optimisation et protocole d’évaluation comparables.

L’une partait de poids aléatoires. L’autre partait du modèle Helix 2.5 préentraîné sur Index.

Figure annonce 9 % de réussite zero-shot pour le modèle depuis zéro et 56 % pour le modèle préentraîné. La tâche devait être terminée entièrement pour compter comme réussite.

Le résultat cherche donc à mesurer ce que le préentraînement sur de nombreuses expériences humaines ajoute au transfert vers une maison inconnue.

Cela reste une expérience menée par Figure sur son propre dataset, ses robots et son protocole. C’est une donnée first-party importante, pas une réplication indépendante.

Pourquoi Index est la pièce centrale

Index est le projet de Figure pour collecter à grande échelle des vidéos de comportements humains dans des environnements variés.

La logique ressemble aux foundation models : apprendre beaucoup de structures générales en préentraînement, puis utiliser moins de données spécifiques pour définir une nouvelle compétence.

Helix 2.5 cherche à montrer que cette idée fonctionne aussi pour le contrôle physique d’un humanoïde.

Figure affirme qu’un comportement Helix 2.5 atteint le niveau d’une politique Helix 02 comparable avec moitié moins de données spécifiques, tout en fonctionnant dans 30 maisons inconnues.

Les critères de réussite comptent énormément

Figure publie des règles assez détaillées.

Pour le rangement du salon, les 13 à 15 jouets devaient tous finir dans le panier. Pour les serviettes, il fallait les plier et les mettre dans le panier. Pour le lit, oreillers et couette devaient atteindre des zones et alignements définis.

Figure précise également qu’une intervention humaine nécessaire pour la sécurité entraîne l’arrêt et l’échec du rollout.

Cela ne rend pas l’étude indépendante, mais rend la vidéo beaucoup plus interprétable qu’une compilation de réussites sans définition de l’échec.

Ce que Helix 2.5 ne prouve pas encore

56 % de réussite ne signifie pas que le robot domestique généraliste est résolu.

Trente maisons offrent une diversité intéressante, mais cela reste un échantillon limité. Trois familles de comportements ne couvrent pas l’ensemble des demandes quotidiennes.

L’étude ne répond pas non plus aux questions de coût, maintenance, certification, disponibilité ou fréquence d’assistance humaine sur plusieurs mois.

Pourquoi cette annonce compte

Pendant longtemps, l’humanoïde a surtout été évalué sur des démonstrations impressionnantes mais fortement liées à un environnement.

Helix 2.5 déplace la question vers un critère plus utile : un même comportement survit-il au changement de maison, d’objets et de disposition sans réentraînement local ?

Si le transfert depuis de larges datasets humains continue réellement à s’améliorer avec l’échelle, cela pourrait réduire fortement le coût d’installation d’un robot dans un nouvel environnement.

C’est ce qui rend l’annonce importante — et ce qui rend les futures réplications indépendantes tout aussi importantes.

Sources & provenance

Une source du fabricant documente ses déclarations ; elle ne constitue pas une vérification indépendante.

  1. Helix 2.5: Zero-Shot 30-Home Generalization ↗
    Figure · Source du fabricant · EN
    Consulté le · Publié le
  2. Introducing Index: Building The World’s Largest and Most Diverse Physical Dataset ↗
    Figure · Source du fabricant · EN
    Consulté le · Publié le
  3. Figure 03 ↗
    Figure · Source du fabricant · EN
    Consulté le