Veille IA #24
Cette semaine, le signal le plus net vient des agents de developpement : meilleure memoire de contexte, modeles locaux plus accessibles, outils d’observation des actions, et recherche plus precise sur les points de rupture entre intention et execution.
Pour un lecteur technique, l’enjeu n’est pas seulement de savoir quel modele sort cette semaine. Il est surtout de comprendre ce qui devient testable dans un workflow reel : coder, lancer des commandes, auditer les actions d’un agent, puis verifier que le resultat tient au-dela d’une demonstration.
Outils retenus
OpenAI Computer History : moins de contexte a repeter
OpenAI a annonce une mise a jour de Computer History pour ChatGPT desktop : l’application peut memoriser l’activite dans les apps et sites afin de reduire le contexte que l’utilisateur doit repeter au fil d’un workflow long.
Source officielle : OpenAI sur X.
Ce qui compte ici, c’est la continuite. Les assistants de code ou de productivite deviennent vite moins utiles quand il faut leur reconstituer sans cesse l’etat du travail : fichiers ouverts, pages consultees, outils utilises, et sequence d’actions deja effectuees. Une memoire d’activite peut donc ameliorer l’ergonomie des taches longues.
La prudence reste importante : la fonctionnalite est opt-in et son deploiement est progressif. Pour les equipes techniques, cela implique de tester le comportement dans un cadre controle, notamment sur les questions de confidentialite, de separation entre projets, et de qualite du contexte reutilise.
Gemini 3.7 Flash : un modele annonce plus fort en code et web app
Google DeepMind a annonce Gemini 3.7 Flash, presente comme plus performant en code, creation d’applications web et travail de connaissance.
Source officielle : Google DeepMind sur X.
L’interet pratique est clair : les modeles “Flash” visent generalement des usages ou le compromis vitesse, cout et qualite compte beaucoup. Si les gains annonces se confirment hors benchmarks editeur, ce type de modele peut devenir pertinent pour des assistants integres a des outils de developpement, des generateurs d’interfaces ou des workflows documentaires.
Le point a verifier reste la robustesse en conditions reelles : comprehension d’un depot existant, respect des conventions locales, qualite des modifications multi-fichiers, et capacite a ne pas produire seulement du code plausible mais maintenable.
Qwen3.8 27B sur Ollama : une option locale actionnable
Qwen3.8 27B est disponible via Ollama, avec une orientation agents et coding. Les annonces viennent d’Ollama et de Qwen.
Sources : Ollama sur X, Qwen sur X.
C’est probablement l’outil le plus directement actionnable de la semaine pour les profils techniques. Une disponibilite via Ollama abaisse fortement la barriere de test : installation locale, integration dans des harnesses de developpement, evaluation sur des depots internes ou personnels, et comparaison avec des modeles deja utilises.
Ce qui change en pratique : on peut mesurer plus vite si un modele local tient sur des taches utiles, par exemple lire une base de code, proposer un correctif, expliquer une regression ou assister un agent de code. Le bon reflexe reste de benchmarker sur des depots reels plutot que de s’arreter aux annonces.
DeepSeek Harness v0.1 avec Ollama : observer les agents
DeepSeek a annonce une developer preview de DeepSeek Harness v0.1, un harness agentique open source. Ollama a ensuite annonce son support, avec des trajectoires visibles et de la recherche web.
Sources : DeepSeek sur X, Ollama sur X.
Le mot important ici est “observabilite”. Quand un agent echoue, il ne suffit pas toujours de lire sa reponse finale. Il faut comprendre quelles actions il a tentees, quelles commandes il a lancees, quelles pages ou ressources il a consultees, et ou la trajectoire a derive.
Pour un usage production, l’outil est encore a considerer comme immature. Mais pour l’evaluation, il est utile : il permet de regarder le comportement d’un agent comme une sequence d’etapes auditables, pas comme une boite noire qui rend seulement un resultat.
Recherche
QuoteBench : quand l’agent sait quoi faire, mais casse l’execution
Le probleme est simple : un agent de code peut choisir la bonne commande, mais l’executer de travers. Dans un shell, les guillemets, l’echappement, la serialisation et le parsing peuvent suffire a transformer une intention correcte en commande invalide ou dangereusement differente.
QuoteBench etudie precisement ce decalage entre ce que le modele semble vouloir faire et ce qui est effectivement execute.
Source primaire : arXiv 2608.13547.
Pour un lecteur technique, c’est un rappel tres concret : evaluer un agent de code uniquement sur sa reponse textuelle ne suffit pas. Il faut aussi verifier l’interface avec l’environnement d’execution. Le modele peut avoir raison conceptuellement, puis echouer au moment ou la commande passe par une couche d’orchestration, de citation ou de parsing.
Ce travail est ciblé, donc il ne remplace pas une evaluation complete. Mais il donne un critere de qualite tres utile avant production : les agents doivent etre testes sur la fidelite entre intention, commande serializee et effet reel.
Vero : vers des depots accompagnes de preuves
Le probleme traite par Vero est plus ambitieux : peut-on demander a des agents de construire des depots formellement verifies ? Autrement dit, peut-on aller au-dela du code qui semble correct pour obtenir du code accompagne de preuves verifiables par machine ?
Source primaire : arXiv 2608.13522.
Pour les developpeurs, l’interet n’est pas seulement theorique. La verification formelle vise a reduire l’ecart entre “ce code a l’air bon” et “ce code respecte effectivement une propriete precise”. Si des agents peuvent contribuer a produire ce type de preuve, ils pourraient devenir plus utiles dans les domaines ou la confiance est critique.
La prudence reste de mise : le rapport indique que c’est prometteur, mais encore loin d’un developpement generaliste fiable. En pratique, il faut y voir une direction de recherche importante plutot qu’un remplacement immediat des workflows classiques de test, revue et validation.
Conclusion
La priorite de test cette semaine est claire : Qwen3.8 27B pour evaluer un modele local oriente agents de code, et DeepSeek Harness pour mieux observer ce que font les agents pendant leurs trajectoires.
Cote recherche, QuoteBench fournit un signal particulierement utile : avant de mettre un agent en production, il faut tester non seulement ses reponses, mais aussi la maniere dont ses intentions deviennent des commandes executees.