Avancées technologiques en IAIA & robotique

S1 de Skild AI : ce que l’apprentissage par vidéo change réellement pour la robotique

Présenté par Skild AI en août 2026, S1 est un modèle fondation pour la robotique conçu pour exécuter une tâche nouvelle à partir d’une seule démonstration vidéo, sans entraînement supplémentaire propre à cette tâche. Les essais publiés montrent des progrès sur des séquences de manipulation pouvant durer jusqu’à dix minutes, mais ils reposent encore sur des évaluations internes. L’enjeu dépasse donc la démonstration technique : il consiste à déterminer si cet apprentissage en contexte peut devenir suffisamment fiable, sûr et contrôlable pour des environnements professionnels.

01

Ce qui vient de se passer

Skild AI a présenté S1 en août 2026 comme son modèle fondation phare pour la manipulation robotique. Le système reçoit une vidéo montrant une tâche, puis tente de reproduire l’objectif observé avec un robot, sans modifier ses poids et sans phase de post-entraînement spécifique. Le 10 septembre, NVIDIA a détaillé l’infrastructure utilisée pour entraîner, simuler et déployer ce modèle, notamment Cosmos, Omniverse, Isaac Sim et Isaac Lab.[1][2]

La promesse concerne des tâches nouvelles et longues. Skild AI montre S1 rempotant une plante, préparant un café filtre, réalisant des crêpes ou assemblant un kit. Certaines séquences durent jusqu’à dix minutes et mobilisent plusieurs gestes successifs. Pour le rempotage, l’entreprise indique être passée de l’enregistrement de la démonstration au début de l’exécution autonome en onze minutes.[1][2]

Cette chronologie doit être précisée : S1 n’a pas été lancé le 10 septembre. L’annonce initiale remonte à août 2026, tandis que la publication de NVIDIA du 10 septembre présente la collaboration technique et les usages de ses plateformes de calcul et de simulation.

02

Ce qui est réellement nouveau

L’idée d’enseigner un geste à un robot par démonstration n’est pas nouvelle. La programmation par démonstration, l’imitation et la téléopération sont étudiées depuis plusieurs décennies. Ce qui distingue S1 est l’ambition de transférer à la robotique un mécanisme devenu central dans les grands modèles de langage : l’apprentissage en contexte.

Dans ce cadre, la vidéo ne sert pas à réentraîner le modèle. Elle est placée dans son contexte au moment de l’utilisation. S1 doit en extraire l’intention, reconnaître les objets pertinents, suivre l’avancement de la tâche et traduire la démonstration en actions compatibles avec le robot et la scène présents. L’entreprise affirme que le même ensemble de poids produit tous les exemples présentés.[1]

La nouveauté revendiquée porte aussi sur la durée et la nouveauté des tâches. Skild AI indique que plusieurs scénarios n’apparaissaient pas dans les données de pré-entraînement et qu’ils combinaient des gestes élémentaires dans des séquences inédites. Si cette capacité se confirme hors des essais internes, elle pourrait réduire le coût de collecte de données et de spécialisation pour chaque nouvelle opération.

MSc IA Génératives et Agentiques aivancity
aivancity

MSc IA Génératives
et Agentiques

Devenez expert des IA génératives et agentiques : LLMs, transformers, déploiement en entreprise. Learning trip Silicon Valley inclus. Titre RNCP niveau 7 (Bac+6).

12 mois — Bac+6 Bac+5 avec expérience Part-time — vendredis & samedis Campus Paris-Villejuif
Découvrir le programme → Titre RNCP niveau 7
03

Comment S1 apprend à partir d’une vidéo

S1 est entraîné sur des épisodes dans lesquels une démonstration visuelle décrit la tâche à accomplir. Le modèle apprend à relier ce qu’il observe dans la vidéo à la scène actuelle et aux commandes motrices disponibles. Il ne copie donc pas nécessairement chaque mouvement du démonstrateur. Il cherche à reconstruire une politique d’action qui poursuit le même objectif avec son propre corps robotique.

Le pré-entraînement combine plusieurs familles de données : téléopération, vidéos humaines en vue subjective, simulation et expériences réalisées sur des robots. Chacune répond à une contrainte différente. La téléopération est proche du matériel réel mais coûteuse à produire. La vidéo humaine apporte davantage de diversité, avec un écart plus important entre les gestes humains et ceux du robot. La simulation se développe plus facilement, mais elle doit représenter correctement les contacts, la pression, les collisions et les propriétés physiques.[1]

NVIDIA intervient sur plusieurs étapes de cette chaîne. Cosmos aide à organiser ou enrichir les données vidéo, Omniverse et Isaac Sim fournissent des environnements virtuels, Isaac Lab sert à l’apprentissage par renforcement et TensorRT optimise l’inférence. Ces outils ne constituent pas S1 eux-mêmes. Ils forment l’infrastructure sur laquelle Skild AI entraîne et déploie son modèle.[2]

04

Capacités annoncées et limites à retenir

Capacité ou contrainte Ce qu’il faut comprendre
Démonstration unique Une vidéo sert de contexte à l’exécution. Elle ne garantit pas une réussite systématique dès le premier essai.
Sans post-entraînement Les poids du modèle ne sont pas modifiés pour chaque nouvelle tâche présentée dans les essais.
Tâches longues Les démonstrations publiées atteignent jusqu’à dix minutes et regroupent plusieurs étapes de manipulation.
Adaptation S1 peut, selon Skild AI, gérer certains déplacements d’objets, substitutions et erreurs en cours d’exécution.
Évaluation Les chiffres disponibles proviennent de Skild AI. Aucun benchmark indépendant équivalent n’est encore publié.
Disponibilité S1 est présenté dans des déploiements et partenariats sélectionnés, pas comme un modèle librement téléchargeable.
05

Ce que les résultats permettent réellement d’affirmer

Skild AI compare une politique guidée par démonstration vidéo à un modèle VLA, pour Vision Language Action, piloté par une instruction linguistique. Sur des tâches inédites de quatre à huit minutes, entraînées avec un volume annoncé de 100 000 heures de données, l’entreprise rapporte un taux moyen de réussite cumulée par étape de 66 % pour S1, contre 9 % pour la référence linguistique.[1]

Cette mesure ne correspond pas à une réussite complète de 66 % pour chaque mission. Elle agrège la réussite des différentes étapes. Skild AI précise en outre que des interventions humaines ont été utilisées pour remettre le système en situation après un échec afin que toutes les étapes puissent être évaluées. Cette méthodologie apporte une information sur la progression locale du robot, mais elle ne mesure pas directement la proportion de tâches accomplies intégralement sans aide.

L’entreprise estime également qu’une démonstration en contexte atteint un niveau comparable à environ 380 épisodes de post-entraînement sur les tâches étudiées. Cette équivalence résulte d’une interpolation entre plusieurs points expérimentaux. Elle ne doit pas être comprise comme une règle universelle applicable à toute tâche, tout matériel ou tout environnement.[1]

Résultat publié Valeur annoncée Lecture prudente
Durée maximale montrée Jusqu’à 10 minutes Durée importante pour une démonstration robotique, sur un petit nombre de scénarios choisis.
Tâches inédites 66 % par étape Mesure interne avec reprises humaines après certains échecs, pas un taux de missions entièrement autonomes.
Référence VLA 9 % par étape Comparaison interne entre deux méthodes entraînées dans le protocole défini par Skild AI.
Efficacité de la démonstration Environ 380 épisodes Estimation interpolée, dépendante des tâches, des données et du matériel étudiés.
Tâches déjà vues Environ 96 % Résultat interne sur des tâches proches de la distribution de pré-entraînement.

Ces résultats soutiennent une conclusion limitée mais importante : dans le protocole de Skild AI, une démonstration vidéo apporte davantage d’information qu’une consigne textuelle pour certaines tâches longues et inédites. Ils ne démontrent pas encore qu’un robot généraliste peut apprendre n’importe quelle tâche à partir d’une vidéo, ni qu’il peut fonctionner avec le niveau de sûreté exigé en production.

Aucune publication évaluée par les pairs ni reproduction indépendante de l’ensemble des résultats de S1 n’a été identifiée au 22 septembre 2026. Les vidéos et chiffres de l’entreprise constituent donc des preuves primaires utiles, mais encore insuffisantes pour conclure à une généralisation robuste.

Executive MBA AI & Business Transformation aivancity
aivancity

Executive MBA AI & Business
Transformation

Le MBA repensé pour l’ère de l’IA. Pour dirigeants expérimentés qui veulent piloter la transformation de leur organisation. Paris, Nice & Dubai.

12 mois — Part-time 10 ans d’expérience min. Early bird 20 000 € Paris · Nice · Dubai
06

Pourquoi cette approche peut compter pour l’industrie

Dans l’industrie et la logistique, une part importante du coût d’intégration provient de l’adaptation des robots aux produits, aux postes et aux séquences de travail. Si une démonstration vidéo permet réellement de reconfigurer une tâche en quelques minutes, les lignes de production pourraient gagner en flexibilité, notamment pour les petites séries, les changements fréquents ou les opérations difficiles à formaliser par du code.

Le rôle des opérateurs évoluerait également. Leur expertise gestuelle pourrait devenir une source directe d’instructions pour les systèmes robotiques. Cela créerait de nouveaux besoins en préparation des démonstrations, validation des trajectoires, analyse des erreurs et supervision des déploiements. L’automatisation ne supprimerait donc pas nécessairement l’intervention humaine, mais déplacerait une partie du travail vers la transmission, le contrôle et la gouvernance des gestes.

Skild AI et NVIDIA citent des usages dans la fabrication, la logistique, l’inspection, la sécurité et la préparation alimentaire. Un partenariat avec Foxconn doit notamment appliquer le Skild Brain à des manipulateurs à deux bras pour l’assemblage de systèmes NVIDIA Blackwell.[2] Ces annonces constituent des signaux de déploiement, mais les données publiques ne permettent pas encore d’évaluer la disponibilité, la fiabilité continue, le coût par tâche ou les incidents rencontrés en production.

07

Une vidéo ne suffit pas à garantir la généralisation

Une démonstration ne couvre qu’une trajectoire possible. Dans un atelier réel, les objets changent d’orientation, les outils s’usent, l’éclairage varie et des personnes peuvent entrer dans la zone de travail. La généralisation exige que le modèle distingue l’objectif de la séquence exacte observée et qu’il sache réagir à des situations absentes de la vidéo.

Skild AI montre des essais dans lesquels S1 poursuit une tâche après le déplacement ou la substitution d’un objet. L’entreprise indique aussi que le système peut reprendre une action après certains échecs. Ces comportements sont intéressants, mais ils restent présentés sur des exemples sélectionnés. Une évaluation industrielle devrait documenter les taux d’échec complet, les quasi-accidents, les conditions de reprise, les différences entre robots et la dégradation sur de longues périodes.

L’adaptation rapide crée également un problème de validation. Si chaque opérateur peut enseigner une nouvelle tâche, l’organisation doit décider qui est autorisé à le faire, comment la démonstration est vérifiée, dans quel environnement elle peut être exécutée et comment revenir à une version antérieure. L’apprentissage en contexte réduit potentiellement le temps de programmation, mais il ne supprime ni la qualification du procédé ni la responsabilité du déploiement.

08

Sécurité, responsabilité et cadre juridique

Un modèle robotique agit dans le monde physique. Une erreur ne produit pas seulement un texte incorrect : elle peut endommager un objet, interrompre une production ou blesser une personne. Les mécanismes de limitation d’effort, d’arrêt d’urgence, de séparation des zones, de surveillance de vitesse et de validation humaine restent donc essentiels, même lorsque la politique d’action est générée par un modèle fondation.

Dans l’Union européenne, le règlement sur l’intelligence artificielle s’applique progressivement. Un système d’IA intégré comme composant de sécurité à un produit couvert par la législation européenne peut relever du régime des systèmes à haut risque lorsque les conditions de l’article 6 sont réunies. Les obligations associées aux systèmes visés par l’article 6, paragraphe 1, doivent en principe s’appliquer à partir du 2 août 2027.[4] Tous les robots utilisant S1 ne deviennent donc pas automatiquement des systèmes à haut risque : la qualification dépend de la fonction, du produit et du contexte d’usage.

Le règlement européen sur les machines, qui doit s’appliquer principalement à partir du 20 janvier 2027, renforce parallèlement l’attention portée aux logiciels et aux fonctions de sécurité des machines.[5] Pour un déploiement professionnel, l’évaluation devra articuler la sûreté de la machine, la cybersécurité, la gestion des modifications logicielles et les exigences liées au système d’IA. Cette présentation reste générale et ne constitue pas un conseil juridique.

La responsabilité doit aussi être répartie clairement entre le fournisseur du modèle, le fabricant du robot, l’intégrateur, l’employeur et l’utilisateur. Les journaux d’exécution, la version du modèle, la vidéo utilisée comme démonstration, les paramètres de sécurité et les interventions humaines doivent pouvoir être retracés lorsqu’une décision ou un incident est analysé.

09

Données, travail et impact environnemental

Les vidéos de démonstration peuvent enregistrer des salariés, des espaces de production, des procédés confidentiels ou des objets protégés. Leur collecte doit être limitée à ce qui est nécessaire, sécurisée et encadrée par des règles de conservation et d’accès. Lorsque des personnes sont identifiables, le RGPD peut s’appliquer. Les organisations doivent également vérifier les droits sur les vidéos et la protection de leur savoir-faire industriel.

Sur le plan social, l’apprentissage par observation peut valoriser l’expertise des opérateurs, mais aussi faciliter une captation de leurs gestes sans reconnaissance suffisante. Le déploiement responsable suppose d’associer les équipes, de documenter les changements de poste, de former à la supervision et d’éviter que la vidéo ne devienne un outil de surveillance individuelle. La qualité ergonomique d’un geste humain ne signifie pas non plus qu’il soit automatiquement sûr ou optimal pour un robot.

Enfin, Skild AI ne publie pas de bilan énergétique complet pour l’entraînement ou l’inférence de S1. La simulation et la réutilisation d’un modèle généraliste peuvent réduire certaines collectes physiques, mais l’entraînement sur de grands volumes de données et le recours à une infrastructure accélérée ont un coût matériel et énergétique. Sans mesures comparables, aucun bénéfice environnemental net ne peut être affirmé.

10

Ce qu’il faudra observer maintenant

La prochaine étape décisive ne sera pas une nouvelle vidéo de démonstration, mais la publication de protocoles reproductibles et de résultats indépendants. Il faudra notamment mesurer la réussite complète sans intervention, la robustesse sur des objets et robots différents, la sécurité en présence de personnes, le temps d’arrêt, le coût de calcul et la capacité à expliquer les échecs.

Il faudra également suivre les déploiements industriels annoncés. Une démonstration ponctuelle et une production continue répondent à des exigences très différentes. Les données les plus instructives seront celles qui décrivent le fonctionnement sur plusieurs semaines, le nombre d’interventions humaines, les modifications nécessaires et les conditions dans lesquelles le système doit être désactivé.

S1 représente ainsi une avancée crédible dans l’apprentissage robotique en contexte, mais pas encore la preuve d’un robot universel apprenant instantanément. Sa portée réelle dépendra de sa capacité à transformer une démonstration prometteuse en processus fiable, vérifiable et responsable.

Pour aller plus loin

Pour replacer S1 dans l’évolution des modèles robotiques, de l’IA embarquée et des métiers industriels, découvrez également ces analyses du blog aivancity.

Sources

[1] Skild AI, août 2026. Introducing S1: In-Context Learning for Robotics. Consulté le 22 septembre 2026. Consulter la source

[2] NVIDIA, 10 septembre 2026. Skild AI Taps NVIDIA Physical AI to Teach Robots New Tasks From a Single Video. Consulter la source

[3] Robotics and Automation News, 14 septembre 2026. Skild AI Unveils S1 Robot Foundation Model That Learns Tasks From Video Demonstrations. Lire l’article

[4] Commission européenne. Cadre réglementaire européen sur l’intelligence artificielle. Consulté le 22 septembre 2026. Consulter le cadre réglementaire

[5] Union européenne, 2023. Règlement (UE) 2023/1230 relatif aux machines. Consulter le règlement

Ne ratez pas nos prochains articles !

Recevez les prochains articles écrits par les experts et professeurs aivancity directement dans votre boîte de réception.

Nous ne spammons pas ! Consultez notre politique de données personnelles pour plus d’informations.

Ne ratez pas nos prochains articles !

Recevez les prochains articles écrits par les experts et professeurs aivancity directement dans votre boîte de réception.

Nous ne spammons pas ! Consultez notre politique de données personnelles pour plus d’informations.

Related posts
Avancées technologiques en IAIA Génératives

GPT-5.6 Sol accélère x10 : OpenAI dévoile son nouveau mode Ultrafast

Quelques semaines après avoir généralisé GPT-5.6, OpenAI s’attaque à un autre défi majeur de l’intelligence artificielle : la latence. Avec son nouveau mode Ultrafast, l’entreprise veut permettre à son modèle phare GPT-5.6 Sol de produire…
Avancées technologiques en IA

OpenAI lance GPT-5.5 Instant avec une réduction des erreurs et des réponses plus rapides

OpenAI poursuit l’évolution rapide de ses modèles d’intelligence artificielle avec le lancement de GPT-5.5 Instant, une nouvelle déclinaison pensée pour répondre à un enjeu devenu central dans l’industrie, produire des réponses plus rapides tout en…
Avancées technologiques en IA

Google AI Edge Eloquent : une solution de dictée vocale gratuite et hors ligne

L’intelligence artificielle continue de se diffuser dans les usages quotidiens, mais une transformation plus discrète est en train de s’opérer, celle du passage du cloud vers l’edge. Avec AI Edge Eloquent, Google propose une application…