Veille IA #29

Cette semaine, la sélection met surtout en avant deux mouvements : des modèles plus spécialisés dans l’action, la voix et le multimodal, puis des travaux de recherche qui cherchent à rendre l’IA plus vérifiable, soit dans la science, soit dans l’imagerie médicale.

Outils retenus

Jev et TypeSafe AI : des décisions typées plutôt que du texte libre

Jev, présenté par TypeSafe AI, propose une approche intéressante pour les agents : au lieu de produire principalement du texte, le modèle “System One” vise des décisions structurées, typées, accompagnées de probabilités. L’outil est aussi disponible via Vercel AI Gateway.

Pour un lecteur technique, l’intérêt est immédiat. Beaucoup de systèmes d’agents échouent moins sur la génération de texte que sur la prise de décision fiable : choisir un outil, classer une demande, router une tâche, déclencher ou non une action. Un modèle pensé pour retourner une décision typée peut réduire le besoin de parser une réponse libre, puis d’en deviner l’intention.

Les promesses annoncées, 70 à 500 ms et 0,042 dollar par million de tokens, sont attractives, mais elles restent à vérifier sur des cas réels. Le point important n’est donc pas seulement le coût ou la vitesse affichés. C’est la possibilité de traiter certaines étapes d’un agent comme des décisions testables, observables et comparables, plutôt que comme des morceaux de langage difficiles à contrôler.

Gemini 3.8 Live : voix, vision et outils en arrière-plan

Google a annoncé le 15 septembre de nouveaux modèles vocaux, Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, disponibles via API et AI Studio. Le rapport mentionne plus de 97 langues, la vision en temps réel et les appels d’outils en arrière-plan.

Ce qui compte ici, c’est la convergence entre conversation vocale, perception visuelle et action. Pour une application technique, cela ouvre des scénarios plus naturels : assistance en direct, analyse d’un flux visuel, interaction orale avec un système métier, ou pilotage d’outils sans casser le dialogue utilisateur.

La partie “Extended Thinking” signale aussi une tension importante du moment : les interfaces vocales doivent rester fluides, mais certaines tâches exigent davantage de raisonnement. Le défi pratique sera donc de savoir quand privilégier la latence faible, et quand accepter un temps de réponse plus long pour une meilleure qualité de décision.

Qwen3.8-Omni-Flash : un modèle omni-modal très large

Qwen3.8-Omni-Flash, daté du 17 septembre, est présenté comme un modèle capable de traiter texte, image, audio et vidéo en entrée. La fiche côté Alibaba Cloud Model Studio mentionne aussi un contexte de 1 million de tokens, le function calling, la recherche web et le cache.

Pour les équipes qui construisent des produits IA, le sujet n’est pas seulement “un modèle de plus”. Un modèle omni-modal avec un grand contexte peut simplifier des architectures qui empilent aujourd’hui plusieurs briques : transcription audio, extraction visuelle, résumé vidéo, recherche, puis appel d’outils.

En pratique, cela peut réduire la complexité d’intégration, mais pas supprimer les questions d’évaluation. Il faudra tester la robustesse selon les formats d’entrée, la qualité des appels de fonction et le comportement sur de longs contextes. Le grand contexte est utile seulement si le modèle sait l’utiliser de manière fiable.

Astra for Law : une IA spécialisée pour le droit

Astra for Law est une déclinaison juridique de GPT-6 Astra, avec un Legal Search Index américain, des consignes métier et des plugins juridiques. L’accès initial est limité à des cabinets sélectionnés. L’annonce a aussi été relayée par OpenAI sur X.

L’intérêt technique est dans la spécialisation verticale. Le droit n’est pas seulement un domaine où il faut “bien rédiger”. Il faut retrouver des sources pertinentes, suivre des consignes précises, distinguer les juridictions et limiter les erreurs d’interprétation. Un produit conçu autour d’un index juridique et de workflows dédiés peut être plus utile qu’un assistant généraliste branché après coup sur quelques documents.

La prudence reste nécessaire : le rapport ne donne pas d’évaluation indépendante ni de détail sur les performances. Mais la direction est claire. Les meilleurs usages professionnels de l’IA ne viendront pas uniquement de modèles plus puissants. Ils viendront aussi de systèmes plus cadrés, connectés aux bons corpus et intégrés aux pratiques du métier.

Ternary Bonsai 2 27B : compression et déploiement plus léger

PrismML annonce Ternary Bonsai 2 27B, une mise à jour sous licence Apache 2.0. Le modèle est présenté comme une version compressée de Qwen3.8-27B, avec un fichier GGUF de 5,9 Go, un contexte de 262K et 98,2 % de la performance FP16 annoncée.

Pour un lecteur technique, le point central est le compromis entre taille, coût de déploiement et qualité. Un modèle plus compact peut rendre certains usages locaux ou embarqués plus réalistes, surtout lorsque les contraintes de mémoire, de latence ou de confidentialité sont fortes.

Les scores restent fournis par l’éditeur, donc ils doivent être traités comme un signal initial plutôt que comme une preuve. Mais l’évolution est importante : la compression de modèles devient un levier stratégique, pas seulement une optimisation de confort. Elle peut décider si un modèle est utilisable dans un vrai produit, sur une vraie machine, avec un budget maîtrisé.

Recherche

Paper2Agent : transformer un article scientifique en agent vérifiable

Le problème est simple à formuler : beaucoup de résultats scientifiques sont difficiles à reproduire. Même quand un article est publié avec du code, il faut comprendre l’environnement, les paramètres, les données et les enchaînements nécessaires pour obtenir un résultat exploitable.

Paper2Agent, publié dans Nature, s’attaque à ce problème en transformant des articles et leur code en serveurs MCP validés, puis en agents “auteurs virtuels”. MCP, ici, désigne un protocole permettant à un modèle d’interagir avec des outils ou des ressources de manière structurée.

Ce que cela change en pratique, c’est la possibilité de passer d’un article statique à une interface plus opérationnelle. Un chercheur ou un ingénieur pourrait interroger le travail, relancer certaines étapes, vérifier des hypothèses ou explorer le code avec moins de friction.

La limite mentionnée est importante : l’approche dépend de papiers disposant d’un code exploitable. Elle ne résout donc pas à elle seule le problème général de la reproductibilité. Mais elle montre une direction forte : utiliser les agents non pas seulement pour résumer la science, mais pour rendre ses artefacts plus manipulables et vérifiables.

DAMO RADAR : un modèle vision-langage pour les scanners abdominaux

Le second travail concerne un domaine beaucoup plus sensible : l’imagerie médicale. Le problème est de détecter et décrire des observations sur des scanners abdominaux, un cas où les erreurs peuvent avoir des conséquences importantes.

DAMO RADAR, présenté dans Science avec du code disponible sur GitHub, est un modèle vision-langage pour les scanners abdominaux. Le rapport indique un entraînement sur plus de 400 000 examens et 15 millions de paires image-texte, avec une AUC de 0,913 sur 146 findings.

Pour un lecteur technique, l’information clé n’est pas seulement le score. C’est l’échelle du jeu de données, la spécialisation médicale et le lien entre vision et texte. Les modèles vision-langage peuvent potentiellement aider à structurer l’analyse d’images complexes, mais ils doivent être évalués avec un niveau d’exigence très élevé.

Le rapport précise que l’usage clinique doit rester sous supervision. C’est essentiel. Dans ce type de domaine, l’IA peut être intéressante comme aide, priorisation ou second regard, mais elle ne remplace pas un cadre médical contrôlé.

Conclusion

La semaine confirme une tendance nette : l’IA utile devient plus spécialisée, plus multimodale et plus intégrée aux outils. Les pistes à tester rapidement sont Jev pour les décisions typées dans les agents, puis Gemini 3.8 Live et Qwen3.8-Omni-Flash pour les usages voix, vision et vidéo.

La prudence reste de mise sur les chiffres de coût, de vitesse et de performance tant qu’ils ne sont pas vérifiés sur des cas réels. Elle est indispensable pour tout usage médical.