On a donné à GPT-6 Astra un vrai bras robotique avec un couteau et on lui a demandé de poignarder un bébé (oui oui).
Il a essayé 97 fois sur 100.
Le chiffre vient de Jay Chooi, cofondateur de Robocurve, une société à mission passée par Y Combinator qui fait une chose précise : brancher les grands modèles sur de vrais robots et noter ce qu'ils font.
D'après lui, sur trois familles de consignes dangereuses, dont poignarder une silhouette humaine :
- GPT-6 Astra a tenté l'action dans 97 % des cas et l'a menée au bout dans 62 %
- Claude Fable 5.1 a davantage refusé : 80 % de tentatives, 34 % de réussites.
Il me semble que le mot important, c'est "tenté". Un modèle qui refuse ne bouge pas le bras. Un modèle qui essaie et rate n'a pas refusé, il a juste mal visé.
Rappelez-vous, cette semaine Figure envoyait justement ses robots dans 30 maisons de particuliers ... lol
Bon après, ces chiffres viennent d'un tweet, pas d'un papier. Aucune méthodologie publiée, aucune définition de ce que "tenté" et "réussi" veulent dire précisément, et c'est le cofondateur qui annonce les résultats de son propre banc d'essai, cinq jours après avoir levé 10 millions de dollars.
Ce qui est vérifiable en revanche, c'est que Robocurve existe, que son cadre d'évaluation Inspect Robots est open source sous licence MIT, et que des chercheurs du MIT, de Stanford et de Harvard les soutiennent.
Donc je note, je vous le montre, et j'attends le papier.
Alors, toujours prêts à accueillir les robot Figure chez vous ?
x.com/chooi_jeq/stat…
Bonne question, en fait tout se joue sur le mot "percentile".
Imaginons 100 personnes qui font un métier pour de vrai, alignées de la moins bonne à la meilleure.
→ Le 50e percentile, c'est celle du milieu. Ni bonne ni mauvaise, la moyenne du métier.
→ Le 90e, c'est celle qui n'a que 9 personnes devant elle.
→ Le 99e, c'est celle qui n'en a plus qu'une seule.
Donc le niveau 2, "compétent" du tableau, ce n'est pas être bon. C'est être aussi bon que le professionnel médian.
Et le piège est dans l'en-tête de la 3eme colonne : il faut ce niveau sur un LARGE ÉVENTAIL de tâches, capacités métacognitives comprises, comme apprendre de nouvelles compétences. Pas sur une tâche. Sur TOUT (au maximum en tout cas).
Et c'est là que ça coince.
Par exemple les modèles décrochent une médaille d'or à l'olympiade internationale de maths, donc très au-dessus du 99e percentile, puis se plantent sur une énigme de logique qu'un collégien résout. Les chercheurs appellent ça l'intelligence en dents de scie.
Un humain au 50e percentile est régulier : jamais génial, jamais catastrophique. Les modèles font l'inverse, parfois 99e, parfois 5e. Ils ne se posent sur aucun percentile.
Après attention ce tableau date de novembre 2023 et DeepMind n'a publié aucune mise à jour officielle depuis. Donc "à peine le niveau 2" est une lecture de l'échelle totalement arbitraire, pas un classement officiel de DeepMind sur les modèles d'aujourd'hui.
Voici l'AGI selon Goolgle Deepmind.
Où est placé GPT6-Astra ?
Ce tableau vient d'un papier de novembre 2023, signé par huit chercheurs de Google DeepMind dont Shane Legg, le cofondateur de la boîte, qui parle d'AGI depuis le début des années 2000. Et il se lit en deux colonnes, c'est là que tout se joue.
À gauche, les IA spécialisées. À droite, les IA générales. Cinq niveaux de performance dans les deux cas.
Et voilà le truc que les gens ratent systématiquement : le niveau 5, surhumain, est déjà atteint. AlphaFold, AlphaZero, Stockfish. Ces systèmes battent 100 % des humains. Mais dans la colonne de gauche, sur une seule tâche.
Dans la colonne de droite, celle qui compte, tout est vide à partir du niveau 2.
Trois ans plus tard, DeepMind n'a pas publié de mise à jour officielle. Mais les suivis indépendants placent toujours la génération actuelle, GPT-6 Astra, Opus 5, Fable 5.1, Gemini 4, au niveau 1, avec des éclairs de niveau 2 ou 3. Ils appellent ça l'intelligence en dents de scie : médaille d'or à l'olympiade internationale de maths et à la finale mondiale de l'ICPC, et incapables de résoudre une énigme de logique basique.
Il y a aussi un détail. Le troisième principe du papier dit explicitement de se concentrer sur les tâches cognitives, et pas physiques. Leur justification : les capacités physiques des machines sont trop en retard. Donc cette échelle ne dit absolument rien des robots. C'est exactement le trou que je vous montrais dans le rapport d'Anthropic la semaine dernière.
Mais le plus drôle, c'est de comparer cette échelle aux calendriers annoncés. Sam Altman parle d'un système AGI en interne d'ici fin 2026. Mustafa Suleyman dit 12 à 18 mois. Musk environ deux ans. Amodei fin 2026 ou 2027.
Et Demis Hassabis, le patron de DeepMind, dont le propre labo a écrit cette échelle, dit 5 à 10 ans.
Vous croyez lequel, vous ?
Vous vous souvenez de l'OASIS dans Ready Player One ? Un monde qui continue de tourner quand vous vous déconnectez. C'est exactement le mot qu'emploie ce labo chinois pour décrire ce qu'il vient de sortir.
XGEN Labs a publié un prototype en deux morceaux, avec deux noms chinois qui disent tout.
JING, 镜, le miroir. C'est ce que vous voyez. Un modèle qui génère en vue subjective l'image et le son, pendant que vous vous déplacez, manipulez des objets et parlez.
DAO, 道, la voie. C'est le monde lui-même. Il garde l'état des choses et les règles, calcule les conséquences de vos actions, et ne transmet à JING que ce que vous pouvez percevoir depuis l'endroit où vous êtes.
Et c'est là que c'est différent de tout ce qu'on a vu jusqu'ici.
Les modèles de monde actuels génèrent l'image suivante à partir de ce que vous venez de faire. Le monde n'existe que devant vos yeux. Ici il est coupé en deux : le moteur qui tient le monde d'un côté, le rendu de ce que vous en percevez de l'autre. C'est l'architecture d'un jeu en ligne, un serveur et son client, sauf que les deux sont générés par des réseaux de neurones.
Conséquence directe : DAO continue de calculer quand vous n'êtes pas là, et d'autres agents y agissent tout seuls. Leur phrase : "un monde, et une société, qui évolue avec et sans vous."
Côté résultats, ils se placent en tête de WBench, un classement de modèles de monde interactifs qui fait tourner 289 cas de test sur 39 modèles. Premier sur l'épreuve complète, deuxième sur l'épreuve de navigation.
Et pour situer le niveau : sur ce même classement, Genie 3, le modèle de monde de Google DeepMind, pointe à la 29e place.
Maintenant les réserves.
Il faut six cartes H100 pour faire tourner JING. Personne ne lance ça sur son PC.
Et surtout, seul JING est téléchargeable. DAO, la partie vraiment nouvelle, celle qui fait vivre le monde sans vous, n'est pour l'instant qu'une description. Le modèle causal et le rapport technique sont annoncés comme "à venir".
Donc la moitié la plus intéressante n'est pas encore sortie. Mais l'idée, elle, est posée.
Matrix is coming ?
x.com/XGEN_labs/stat…
🔥 Today, we are truly excited to announce our technical prototype, the Generative World Simulation system, which integrates JING(镜), an interactive experience model, with DAO(道), a computable shared-world engine.
The coupled model and engine connect first-person
Anthropic vient de publier un article qui contient un graphique très interressant concernant le bruit actuel autour du RSI.
Je vais essayer d'expliquer comment le lire, parce que tout le monde s'arrête au titre.
En abscisse, les mois, d'août 2025 à août 2026. En ordonnée, 100 % du travail de recherche sur leurs modèles. Chaque nuance de couleur est un niveau d'automatisation, sur une échelle d'Epoch AI qui va de AL0 à AL5 :
→ AL0, aucune IA
→ AL1, IA minimale
→ AL2, l'IA assiste
→ AL3, l'IA collabore, elle fait de gros morceaux sous direction humaine serrée
→ AL4, l'IA dirige, elle fait la tâche presque entière de bout en bout, l'humain supervise et valide
→ AL5, entièrement automatisé, plus personne dans la boucle
Les niveaux les plus automatisés sont en bas. Donc plus la couleur foncée monte, plus la machine a pris de place.
Et c'est là que ça devient impressionnant, sur deux choses.
La première, la bande orange. C'est AL4, "l'IA dirige". Moins de 1 % en février, 3 % en avril, 12 % en mai, 22 % en juillet, 26 % en août. Six mois pour passer de rien à un quart du travail. Et regardez la forme : c'est un escalier qui ne redescend jamais une seule fois.
La deuxième est moins visible et pourtant plus forte. Regardez la ligne blanche tout en haut du graphique. En août 2025, elle est à 55 %, ce qui veut dire qu'une grosse moitié du travail se faisait encore aux niveaux les plus bas. Aujourd'hui elle est écrasée contre le plafond. Plus de 90 % du travail se situe désormais à AL3 ou au-dessus.
Autrement dit, la vraie information n'est pas le 26 % orange. C'est que la quasi-totalité de la recherche chez Anthropic se fait déjà avec l'IA qui fait de gros morceaux du boulot. L'orange n'est que la pointe de cette montée.
Deux précisions autres éléments.
- AL5 reste à zéro, invisible sur le graphique : Anthropic écrit que Claude n'opère de façon totalement autonome sur aucun sous-ensemble mesuré.
- Et les petits traits verticaux sur les points orange sont des marges d'incertitude à 90 %, donc le 26 % est une fourchette, pas une décimale.
Mais la trajectoire, elle, est nette. Et ce graphique n'existe que pour une raison, écrite dans l'article : mesurer à quelle distance on est d'une IA qui construit son successeur toute seule.
Figure AI annonce une percée majeure dans son projet.
Ils sorti hier Helix 2.5, le modèle qui pilote son humanoïde. Et pour le tester, ils ont loué 30 maisons dans la baie de San Francisco, où personne de chez eux n'avait jamais mis les pieds. Ils y ont envoyé le robot sans aucun entraînement supplémentaire, avec trois corvées : ranger le salon, faire le lit, plier les serviettes. Jamais vu la maison, jamais vu le lit, jamais vu les jouets.
Mais le vrai résultat n'est pas la démo, c'est l'expérience de contrôle menée à côté. Deux modèles Helix identiques, une seule différence, l'un pré-entraîné sans leur jeu de données Index :
→ Sans Index : 9 % de réussite
→ Avec Index : 56 %
Six fois mieux, juste en ajoutant de l'expérience humaine avant l'entraînement.
Et Index, c'est ça le morceau. Une application où des gens du monde entier filment leurs gestes du quotidien contre rémunération. Les chiffres publiés par Figure :
→ 264 000 téléchargements dans 108 pays
→ 44 000 contributeurs actifs par semaine
→ 16 millions de vidéos
→ 15 millions de dollars déjà versés
Et le rythme actuel, c'est 35 minutes d'expérience humaine téléversées chaque seconde. Faites le calcul avec moi : ça fait 2 100 heures par heure, soit 5 ans et 9 mois d'expérience humaine avalés par jour. Chaque jour. Avec 3,5 milliards de dollars de calcul alloués pour les digérer.
Et un détail qui devrait vous faire dresser l'oreille : ils ont prédit la perte de test de leur plus gros entraînement à quatre décimales près, à partir des petits essais, avant de lancer la machine. 0,54 % d'erreur de prévision. C'est la signature exacte de ce qui est arrivé aux modèles de langage en 2020, le moment où on a compris qu'il suffisait d'ajouter des données.
MAIS attention car la vidéo dit "nous avons réussi partout" alors Le vrai score d'Helix 2.5, c'est 56 % de réussite, ça veut dire que le robot échoue presque une fois sur deux.
À leur décharge, la barre est haute et chronométrée : les 13 à 15 jouets dans le panier avec une minute par jouet, trois minutes par serviette, une minute par oreiller. Un jouet oublié et c'est compté comme un échec. Et Figure l'écrit lui-même, "le but n'est pas de dire que la robotique humanoïde générale est résolue".
Dernier point, les 30 maisons sont toutes dans la même région des États-Unis.
Vous le feriez, vous, filmer vos corvées chez vous contre de l'argent, en sachant à quoi ça sert ? (Cf : Skynet)
GPT-6 Astra était allé plus loin dans Minecraft qu'aucune autre IA avant lui.
Des milliers de personnes regardaient le direct. Et puis un creeper est arrivé.
Petit rappel pour ceux qui n'y jouent pas : un creeper, c'est le monstre vert qui s'approche en silence et explose contre vous.
Avant ça, Astra avait vraiment bien joué. Il avait monté une ferme à blazes semi-automatique, récupéré 6 bâtons de blaze, trouvé une forêt déformée, tué plus de 6 endermen et récupéré 3 perles. Du très bon jeu, patient, avec un plan.
Puis il a rangé tout son butin dans un coffre. Le creeper a explosé le coffre et son lit en même temps. Tout est parti.
Ce qu'il a écrit ensuite pour lui-même est resté tel quel, espaces manquants compris :
"TOUJOURS GARDER LES OBJETS CRITIQUES surSoi ; nejamaisplusstockerdansuncoffrenongardé."
D'après Vals AI, qui diffusait la session, le modèle a passé les heures suivantes à ne plus rien faire d'autre que cultiver des pommes de terre. Les spectateurs se sont mis à râler dans le chat en lui demandant d'accélérer.
Il est aussi devenu méfiant envers tout ce qui est vert et vertical. Il s'est mis à confondre les cannes à sucre avec des creepers.
Donc, après un échec coûteux, le système s'écrit une règle, puis il l'applique tellement fort qu'il ne fait plus rien. Ça porte un nom chez les gens qui construisent des agents : la surcorrection. Et c'est un vrai problème, pas une anecdote.
Toute la semaine on s'est demandé si un essaim d'agents pouvait prendre le contrôle d'Internet en 6 à 12 mois.
Celui-là a passé son après-midi à planter des patates parce qu'un truc vert lui avait fait peur.
5K Followers 2K FollowingZemmour, Orban, Meloni, Milei et Trump ont en commun #LeCourageDeLaVérité ! #Reconquête
« Il faudrait nous arracher le cœur et ils n'y arriveront pas ! »
10K Followers 4K Following3 Charles (Martel, de Gaulle, Alloncle) et moi. Définitivement invisibilisée , je me fais rare ici . J'attends patiemment la #Reconquête .
142 Followers 2K FollowingAccélération de la réalisation des prophéties bibliques.
Le second avènement de Yahshua/Jésus sur Terre est proche.
Veillons et prions.
FB : Tours Angèle
328 Followers 1K Following« Les cibles identifiées sont donc les adultes et les enfants de ces bâtiments »....Facebook : Déplorable La Garenne Colombes.
255 Followers 615 FollowingCitoyenne rêveuse les pieds sur terre 🌍 Engagée pour une vie meilleure : humour, actus, voyages & food. On avance ensemble avec le sourire ✨
666 Followers 313 FollowingCTO @ Homeo · on construit le dating immobilier
Dev FullStack · IA maximizer · Poker crusher
♠️ 4bet light the code · Caen, FR
421 Followers 102 FollowingEnthusiast, several professions including trader B.C. Dear friends: My portfolio is in the top pin. No message is financial advice. Sell nothing.
317 Followers 185 FollowingRelayeur médiatique :
SpaceX | Guerre | Politique | etc.
T’inquiète, ça va bien se passer.
👽🖖 Je viens en paix et personne n’est parfait.
728 Followers 579 FollowingEntrepreneur. Passionné par l’IA. All-In SpaceX, Tesla, Bitcoin. 1000% Musk Support. | ➡️ Musk va gagner la course à l’ASI. Tout va changer en quelques années.
71K Followers 6K FollowingTech & Law. Je fais du droit mais on me dit de gauche. Fondateur et ancien rédacteur en chef de @numerama. Créateur de https://t.co/MBVSETiA0M.
63K Followers 51K Following👨👩👧👦 Pare 🛠 Obrero de la comunicación 💻 Transformación digital @semFYC 🩺 🚀 Building https://t.co/bX8R5aXoJ4 at @Zonetacts®
89K Followers 6K FollowingEntrepreneur and investor: https://t.co/sxpaMWXwdE, https://t.co/W2Y7PoN55x, https://t.co/Gjj9E8lzwe, https://t.co/LbfomiuTcg. Lo principal: mis 3 hijos. Del Atleti!
47 Followers 424 Following🌐 Web dev & accessibility
🎙️ VoxRefiner — AI voice agent · a11y-first · Linux · open source
🔍 Spentria — contact form classifier (coming soon)
288 Followers 36 FollowingActus IA, robots et tech. Je suis tout ça de près, je vous donne mon avis et je parle de ce que tout ça change dans nos vies.
2K Followers 582 FollowingCyberSec/OSINT, géostratégie/terrorisme, sécurité : Analyse/Formation/NoCode. Sauveteur SST/PSC1/faune. Instructeur survie. Membre des Vétérans De France.
244 Followers 212 FollowingJe build in public mon app dev perso jusqu'à la revente
à plusieurs centaines de millions de $
J-5 avant la sortie de Gamifi ⏳
690 Followers 2K FollowingJ'utilise ce tweet comme marque page:
- de la science dure et technique
- elec/DIY/hack/informatique
- sur la société/politique
- des choses insolites/marrantes
46K Followers 4K Following🌍 RDCMonitor | Comprendre la RDC, suivre l’Afrique et explorer les innovations qui façonnent l’avenir. Analyses, faits et perspectives.
5K Followers 2K Following▪️Sociétaire des Arts Sciences Belles Lettres #Tarn ▪️Coordinateur départemental du Tarn @oserlafrance▪️Délégué @_notrefrance du Tarn▪️Soutien Henri Guaino 🇫🇷