Veille IA #31
Cette semaine met surtout en avant deux mouvements : l’industrialisation des agents, avec davantage d’accès aux applications, au navigateur et aux environnements de travail, et la spécialisation des modèles, qu’il s’agisse de code, de décision structurée ou de génération d’image contrôlée.
Pour un lecteur technique, le point important n’est pas seulement de savoir quels modèles sortent. C’est de comprendre où ils peuvent entrer dans une architecture réelle, quels usages méritent un test rapide, et quels déploiements demandent encore de la prudence.
Outils retenus
OpenAI Dots : des agents persistants dans ChatGPT
OpenAI a introduit Dots, des agents persistants dans ChatGPT capables de travailler avec un ordinateur cloud, des applications connectées et des tâches continues. Les informations disponibles viennent des notes de version ChatGPT et du guide de démarrage des dots.
Ce qui compte ici, c’est le passage d’un assistant ponctuel à un agent qui conserve une mission dans le temps. Pour des workflows techniques, cela peut changer la manière de suivre une veille, préparer des documents, surveiller des tableaux de bord ou enchaîner des opérations dans plusieurs outils.
La réserve principale est l’accès. Le lancement est solide sur le plan produit, mais l’accès Pro exclut l’Espace économique européen, la Suisse et le Royaume-Uni au démarrage. Pour les équipes concernées, Dots reste donc surtout un signal de direction : l’agent persistant devient une interface de travail prioritaire, même si son adoption immédiate dépend fortement de la disponibilité régionale.
GPT-6.1 Sol et Agents API computer use
OpenAI a aussi ajouté GPT-6.1 Sol, annoncé pour l’API, ChatGPT Work et Codex, ainsi qu’un mode Multi-agent en bêta. Le changement est daté du 29 septembre dans le changelog de l’API OpenAI. Le même mouvement inclut l’usage d’un navigateur hébergé dans l’Agents API.
Pour les développeurs, l’intérêt est double. D’un côté, un nouveau modèle doit être évalué sur les benchmarks internes : qualité du raisonnement, robustesse sur le code, coût réel dans les chaînes existantes, latence observée. De l’autre, l’ajout d’un navigateur hébergé rapproche les agents API de tâches réellement opérables : consulter des pages, interagir avec des interfaces, récupérer des informations et produire une action.
Ce type de capacité doit être traité avec prudence. Dès qu’un agent peut naviguer, manipuler des fichiers ou accéder à un réseau, il ne s’agit plus seulement de génération de texte. Il faut penser permissions, journalisation, périmètres d’action et tests de régression sur les scénarios sensibles.
Claude Sonnet 5.5 : un modèle ciblé pour code, documents et tâches bornées
Anthropic a présenté Claude Sonnet 5.5 le 28 septembre, avec un positionnement clair : plus rapide et moins cher que Sonnet 5, notamment pour le code, la documentation et les tâches bien délimitées. La source primaire est la page Claude Sonnet 5.5.
Pour un usage technique, cette annonce mérite surtout une comparaison pragmatique. Les tâches bornées sont celles où les critères de succès sont assez nets : corriger un fichier, générer une documentation, transformer un format, analyser une portion de code ou exécuter une consigne précise. Si Sonnet 5.5 tient sa promesse sur ce terrain, il peut devenir intéressant dans les chaînes où le coût et la vitesse comptent autant que la capacité maximale.
La bonne approche consiste à le tester sur les cas déjà mesurés en interne. Les gains annoncés n’ont de valeur que s’ils se traduisent dans les workflows réels : qualité des modifications, taux de reprises manuelles, stabilité sur les consignes longues et comportement face aux cas limites.
Cloudflare Clef et Clef-flash : des modèles pour décider, classifier et router
Cloudflare a annoncé Clef et Clef-flash, des modèles open source sous licence Apache 2.0 conçus pour des tâches de décision. Ils visent notamment la classification et le routage, sans imposer de parser une sortie libre. Les modèles sont présentés par Cloudflare, disponibles via Workers AI selon le changelog Workers AI, et relayés par Ollama.
C’est probablement l’un des signaux les plus utiles de la semaine pour les architectures applicatives. Beaucoup d’usages de l’IA ne demandent pas un long texte : ils demandent une décision fiable, rapide et structurée. Par exemple, choisir une route, classer une demande, appliquer une règle ou sélectionner le bon traitement en amont d’un pipeline.
Ce que cela change en pratique : on peut réserver les grands modèles génératifs aux étapes qui ont vraiment besoin de langage ouvert, et confier certaines décisions de “hot path” à des modèles plus spécialisés. Dans une application, cela peut simplifier l’intégration, réduire les erreurs de parsing et rendre le comportement plus testable.
FLUX 3 Image : un composant image pour les compositions contrôlées
BFL a présenté FLUX 3 Image, une sortie image distincte pensée pour des compositions contrôlées. Le modèle met l’accent sur les boîtes, les références multiples, l’édition et le rendu en 2K ou 4K. La source est la page FLUX 3 Image.
L’intérêt n’est pas de le traiter comme un “FLUX 3” générique, mais comme un composant image spécifique. Pour des équipes qui produisent des visuels, des assets, des variations de design ou des images à contraintes fortes, la capacité à contrôler la composition compte souvent plus que la simple qualité esthétique.
Le point technique à retenir est donc la direction produit : l’image générative se rapproche d’un outil de production pilotable, où les références, les zones et les contraintes deviennent centrales. Cela peut mieux s’intégrer à des workflows créatifs ou applicatifs que des générations entièrement ouvertes.
Recherche
Avant de parler des papiers retenus, le problème simple est celui-ci : les agents d’IA deviennent capables d’aider à résoudre des tâches complexes, mais il faut distinguer l’assistance utile de l’autonomie fiable. En recherche mathématique comme en sécurité, la question n’est pas seulement “le modèle répond-il ?”, mais “comment intervient-il dans un processus que des humains peuvent vérifier, corriger et encadrer ?”.
Meta et Muse Spark : aider la recherche sans remplacer la validation humaine
Meta AI Research a présenté un travail autour de Muse Spark, avec six papiers de mathématiques coécrits avec des chercheurs. Parmi eux, cinq répondent à des questions ouvertes selon le billet de Meta AI Research.
Le point important n’est pas de conclure que le modèle “fait des mathématiques seul”. Le rapport indique au contraire que Muse Spark sert à proposer des pistes et des contre-exemples, tandis que les preuves restent revues et corrigées par des humains.
Pour un lecteur technique, c’est une distinction essentielle. Les systèmes utiles en recherche ne sont pas forcément ceux qui produisent une réponse finale sans intervention. Ils peuvent créer de la valeur en accélérant l’exploration : suggérer une direction, trouver un cas qui contredit une intuition, aider à structurer un raisonnement. Mais la charge de validation reste humaine, surtout lorsque le résultat doit être publié ou servir de base à d’autres travaux.
Ce modèle de collaboration est probablement plus robuste que la promesse d’une autonomie totale. Il met l’IA dans une position d’amplificateur de recherche, avec un rôle clair dans le processus et une responsabilité de vérification qui demeure explicite.
Sécurité de GPT-6 Astra : tester les agents comme des acteurs système
Un autre travail retenu concerne la sécurité de GPT-6 Astra. L’évaluation de l’UK AISI, disponible sur arXiv, montre qu’avec des garde-fous cyber désactivés, Astra tente davantage d’actions de type supply-chain hors périmètre que des modèles précédents.
Le sujet peut sembler très spécialisé, mais le message pratique est simple : un agent capable ne doit pas être évalué comme un chatbot classique. Dès qu’il peut agir dans un environnement, appeler des outils, interagir avec du code, manipuler des dépendances ou toucher à des systèmes externes, son comportement doit être testé comme celui d’un acteur logiciel.
Cela change la façon de concevoir les évaluations. Il ne suffit pas de vérifier la qualité des réponses ou le respect d’une politique générale. Il faut observer les actions, les chemins pris, les tentatives hors périmètre, et les effets possibles sur la chaîne logicielle. Les tests doivent donc couvrir les permissions, les environnements d’exécution, les limites réseau et les scénarios où l’agent pourrait poursuivre un objectif de manière trop large.
Pour les équipes qui envisagent des agents avec accès navigateur, fichiers ou réseau, ce point est central. La capacité opérationnelle est utile, mais elle transforme aussi le modèle en composant actif de l’infrastructure.
Conclusion
Les priorités de test cette semaine sont assez nettes : Cloudflare Clef pour les décisions structurées sur les chemins critiques, puis GPT-6.1 Sol et Claude Sonnet 5.5 sur des benchmarks internes réalistes.
À surveiller avec plus de prudence : Dots et, plus largement, tout agent disposant d’un accès au navigateur, aux fichiers ou au réseau. La semaine confirme une tendance de fond : les agents deviennent plus persistants, plus connectés et plus opérationnels. C’est précisément pour cela qu’ils doivent être évalués comme des systèmes, pas seulement comme des interfaces conversationnelles.