Vidéos

InSight : apprendre à dévisser puis verser sans démonstration humaine de la tâche

Le Short montre deux gestes enchaînés — ouvrir un bouchon puis verser — mais l’intérêt du projet InSight est la manière dont le système apprend les primitives manquantes sans démonstration humaine de la tâche cible.

TOMORROW, TESTED. / VIDEO

InSight : apprendre à dévisser puis verser sans démonstration humaine de la tâche

Le chargement du lecteur vous connecte à YouTube. Vous pouvez aussi regarder directement.
Voir sur YouTube ↗

InSight rend les primitives d’un VLA pilotables séparément, utilise un VLM pour repérer un geste manquant, collecte automatiquement des essais réussis puis réentraîne le VLA. Les auteurs rapportent 92 % sur le dévissage, 96 % sur le versement et 80 % sur la composition longue.

Ce que nous savons

Principe

InSight segmente des démonstrations existantes en primitives puis utilise un VLM pour identifier et pratiquer les primitives manquantes d’une nouvelle tâche.

Vérifié
Dévissage

Les auteurs rapportent 92 % de réussite pour la primitive de dévissage acquise, contre 32 % pour leur baseline CaP-X.

Vérifié
Versement

Les auteurs rapportent 96 % de réussite pour le versement acquis, contre 16 % pour CaP-X.

Vérifié
Composition longue

Le système enchaîne dévissage et versement dans une tâche de 14 primitives avec 80 % de réussite rapportée, sans démonstration end-to-end de la tâche combinée.

Vérifié
Limite

Ces chiffres proviennent des expériences des auteurs et ne constituent pas une réplication indépendante.

Limite

Le geste visible n’est que la fin du processus

Dans le Short, le robot dévisse un bouchon, le pose, change de prise puis incline la bouteille au-dessus d’un bol. La séquence paraît être une seule compétence.

InSight la décrit autrement : dévisser et verser sont deux primitives acquises séparément, puis réutilisées dans une tâche plus longue.

L’idée centrale du projet est de rendre les primitives d’un modèle vision-langage-action suffisamment pilotables pour qu’un autre modèle puisse identifier ce qui manque à une nouvelle tâche, faire pratiquer ce geste au robot et intégrer les essais réussis dans son entraînement.

Partir de compétences déjà connues

Les chercheurs ne commencent pas avec des démonstrations humaines complètes du dévissage ou du versement. Pour ces expériences, la base d’apprentissage vient de tâches de pick-and-place.

InSight segmente d’abord les démonstrations existantes en primitives étiquetées. Le projet décrit notamment l’alignement d’un plan généré par VLM avec l’état de la pince et le mouvement de l’effecteur.

Le VLA devient alors pilotable primitive par primitive au lieu d’être seulement entraîné à reproduire une tâche entière.

Comment le système acquiert un geste manquant

Pour une nouvelle tâche, le VLM construit un plan et repère les primitives que le VLA ne sait pas encore exécuter.

Ces primitives manquantes sont tentées avec des contrôleurs bas niveau paramétrés par le VLM. Un oracle visuel vérifie la réussite des essais. Les segments réussis sont ensuite étiquetés, ajoutés au dataset puis utilisés pour réentraîner le VLA.

Le résultat intéressant n’est donc pas seulement qu’un VLM appelle un robot à chaque étape. Le projet cherche à transformer une compétence nouvellement découverte en compétence persistante du VLA, réutilisable plus tard.

Les résultats annoncés par les auteurs

Sur le matériel réel, le site du projet rapporte 92 % de réussite sur le dévissage et 96 % sur le versement. La baseline CaP-X est donnée à respectivement 32 % et 16 %.

Les deux primitives sont ensuite combinées dans une séquence de 14 primitives. Les chercheurs annoncent 80 % de réussite sur cette tâche composée, contre 4 % pour CaP-X, sans démonstration humaine end-to-end de la séquence combinée.

Ces chiffres sont ceux de l’équipe InSight. Tomorrow, Tested. ne les présente pas comme une réplication indépendante.

Pourquoi le Short coupe quelques secondes

La source vidéo utilisée pour notre Short est déjà affichée en accéléré ×4 sur le projet. Notre montage retire également une courte phase d’attente et de repositionnement entre le moment où le bouchon est posé et celui où la bouteille est reprise.

C’est donc une démonstration éditée, pas une prise continue en temps réel.

Cette précision compte : une vidéo courte doit rendre l’action compréhensible sans donner l’impression que chaque transition est instantanée.

Ce que cela change pour la robotique

Beaucoup de systèmes d’apprentissage robotique restent limités par leur dataset : une compétence absente des démonstrations reste absente de la politique.

InSight attaque ce problème avec une boucle : identifier le manque, pratiquer, vérifier, ajouter les données réussies, puis réentraîner.

Si cette logique devient robuste à plus grande échelle, le robot ne dépend plus uniquement d’un dataset figé. Il peut étendre progressivement son répertoire à partir de compétences déjà connues.

Cela ne transforme pas automatiquement un VLA en robot généraliste. Le système doit encore déterminer correctement les primitives, les acquérir sans comportement dangereux et maintenir les compétences précédentes.

Le projet rapporte justement que ses compétences de base sont conservées après ajout du dévissage et du versement. C’est l’un des points clés à surveiller dans les systèmes de continual learning physiques.

Le Short Tomorrow, Tested. montre l’exécution finale de la séquence. Les sources ci-dessous permettent d’examiner la méthode, les résultats annoncés et le projet complet.

Sources & provenance

Une source du fabricant documente ses déclarations ; elle ne constitue pas une vérification indépendante.

  1. InSight: Self-Guided Skill Acquisition via Steerable VLAs ↗
    Stanford Multi-Robot Systems Lab · Recherche · EN
    Consulté le
  2. InSight: Self-Guided Skill Acquisition via Steerable VLAs ↗
    arXiv · Recherche · EN
    Consulté le · Publié le