Vue normale

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.
À partir d’avant-hierFlux principal

Quoting Andrej Karpathy

20 décembre 2025 à 00:07

In 2025, Reinforcement Learning from Verifiable Rewards (RLVR) emerged as the de facto new major stage to add to this mix. By training LLMs against automatically verifiable rewards across a number of environments (e.g. think math/code puzzles), the LLMs spontaneously develop strategies that look like "reasoning" to humans - they learn to break down problem solving into intermediate calculations and they learn a number of problem solving strategies for going back and forth to figure things out (see DeepSeek R1 paper for examples).

Andrej Karpathy, 2025 LLM Year in Review

Tags: andrej-karpathy, llm, generative-ai, llm-reasoning, definitions, ai, llms, deepseek

Gemini 3 Flash

17 décembre 2025 à 23:44

It continues to be a busy December, if not quite as busy as last year. Today's big news is Gemini 3 Flash, the latest in Google's "Flash" line of faster and less expensive models.

Google are emphasizing the comparison between the new Flash and their previous generation's top model Gemini 2.5 Pro:

Building on 3 Pro’s strong multimodal, coding and agentic features, 3 Flash offers powerful performance at less than a quarter the cost of 3 Pro, along with higher rate limits. The new 3 Flash model surpasses 2.5 Pro across many benchmarks while delivering faster speeds.

Gemini 3 Flash's characteristics are almost identical to Gemini 3 Pro: it accepts text, image, video, audio, and PDF, outputs only text, handles 1,048,576 maximum input tokens and up to 65,536 output tokens, and has the same knowledge cut-off date of January 2025 (also shared with the Gemini 2.5 series).

The benchmarks look good. The cost is appealing: 1/4 the price of Gemini 3 Pro ≤200k and 1/8 the price of Gemini 3 Pro >200k, and it's nice not to have a price increase for the new Flash at larger token lengths.

It's a little more expensive than previous Flash models - Gemini 2.5 Flash was $0.30/million input tokens and $2.50/million on output, Gemini 3 Flash is $0.50/million and $3/million respectively.

Google claim it may still end up cheaper though, due to more efficient output token usage:

> Gemini 3 Flash is able to modulate how much it thinks. It may think longer for more complex use cases, but it also uses 30% fewer tokens on average than 2.5 Pro.

Here's a more extensive price comparison on my llm-prices.com site.

Generating some SVGs of pelicans

I released llm-gemini 0.28 this morning with support for the new model. You can try it out like this:

llm install -U llm-gemini
llm keys set gemini # paste in key
llm -m gemini-3-flash-preview "Generate an SVG of a pelican riding a bicycle"

According to the developer docs the new model supports four different thinking level options: minimal, low, medium, and high. This is different from Gemini 3 Pro, which only supported low and high.

You can run those like this:

llm -m gemini-3-flash-preview --thinking-level minimal "Generate an SVG of a pelican riding a bicycle"

Here are four pelicans, for thinking levels minimal, low, medium, and high:

A minimalist vector illustration of a stylized white bird with a long orange beak and a red cap riding a dark blue bicycle on a single grey ground line against a plain white background. Minimalist illustration: A stylized white bird with a large, wedge-shaped orange beak and a single black dot for an eye rides a red bicycle with black wheels and a yellow pedal against a solid light blue background. A minimalist illustration of a stylized white bird with a large yellow beak riding a red road bicycle in a racing position on a light blue background. Minimalist line-art illustration of a stylized white bird with a large orange beak riding a simple black bicycle with one orange pedal, centered against a light blue circular background.

I built the gallery component with Gemini 3 Flash

The gallery above uses a new Web Component which I built using Gemini 3 Flash to try out its coding abilities. The code on the page looks like this:

<image-gallery width="4">
    <img src="https://static.simonwillison.net/static/2025/gemini-3-flash-preview-thinking-level-minimal-pelican-svg.jpg" alt="A minimalist vector illustration of a stylized white bird with a long orange beak and a red cap riding a dark blue bicycle on a single grey ground line against a plain white background." />
    <img src="https://static.simonwillison.net/static/2025/gemini-3-flash-preview-thinking-level-low-pelican-svg.jpg" alt="Minimalist illustration: A stylized white bird with a large, wedge-shaped orange beak and a single black dot for an eye rides a red bicycle with black wheels and a yellow pedal against a solid light blue background." />
    <img src="https://static.simonwillison.net/static/2025/gemini-3-flash-preview-thinking-level-medium-pelican-svg.jpg" alt="A minimalist illustration of a stylized white bird with a large yellow beak riding a red road bicycle in a racing position on a light blue background." />
    <img src="https://static.simonwillison.net/static/2025/gemini-3-flash-preview-thinking-level-high-pelican-svg.jpg" alt="Minimalist line-art illustration of a stylized white bird with a large orange beak riding a simple black bicycle with one orange pedal, centered against a light blue circular background." />
</image-gallery>

Those alt attributes are all generated by Gemini 3 Flash as well, using this recipe:

llm -m gemini-3-flash-preview --system '
You write alt text for any image pasted in by the user. Alt text is always presented in a
fenced code block to make it easy to copy and paste out. It is always presented on a single
line so it can be used easily in Markdown images. All text on the image (for screenshots etc)
must be exactly included. A short note describing the nature of the image itself should go first.' \
-a https://static.simonwillison.net/static/2025/gemini-3-flash-preview-thinking-level-high-pelican-svg.jpg

You can see the code that powers the image gallery Web Component here on GitHub. I built it by prompting Gemini 3 Flash via LLM like this:

llm -m gemini-3-flash-preview '
Build a Web Component that implements a simple image gallery. Usage is like this:

<image-gallery width="5">
  <img src="image1.jpg" alt="Image 1">
  <img src="image2.jpg" alt="Image 2" data-thumb="image2-thumb.jpg">
  <img src="image3.jpg" alt="Image 3">
</image-gallery>

If an image has a data-thumb= attribute that one is used instead, other images are scaled down. 

The image gallery always takes up 100% of available width. The width="5" attribute means that five images will be shown next to each other in each row. The default is 3. There are gaps between the images. When an image is clicked it opens a modal dialog with the full size image.

Return a complete HTML file with both the implementation of the Web Component several example uses of it. Use https://picsum.photos/300/200 URLs for those example images.'

It took a few follow-up prompts using llm -c:

llm -c 'Use a real modal such that keyboard shortcuts and accessibility features work without extra JS'

llm -c 'Use X for the close icon and make it a bit more subtle'

llm -c 'remove the hover effect entirely'

llm -c 'I want no border on the close icon even when it is focused'

Here's the full transcript, exported using llm logs -cue.

Those five prompts took:

  • 225 input, 3,269 output
  • 2,243 input, 2,908 output
  • 4,319 input, 2,516 output
  • 6,376 input, 2,094 output
  • 8,151 input, 1,806 output

Added together that's 21,314 input and 12,593 output for a grand total of 4.8436 cents.

The guide to migrating from Gemini 2.5 reveals one disappointment:

Image segmentation: Image segmentation capabilities (returning pixel-level masks for objects) are not supported in Gemini 3 Pro or Gemini 3 Flash. For workloads requiring native image segmentation, we recommend continuing to utilize Gemini 2.5 Flash with thinking turned off or Gemini Robotics-ER 1.5.

I wrote about this capability in Gemini 2.5 back in April. I hope they come back in future models - they're a really neat capability that is unique to Gemini.

Tags: google, ai, web-components, generative-ai, llms, llm, gemini, llm-pricing, pelican-riding-a-bicycle, llm-release

LLM 0.28

12 décembre 2025 à 21:20

LLM 0.28

I released a new version of my LLM Python library and CLI tool for interacting with Large Language Models. Highlights from the release notes:
  • New OpenAI models: gpt-5.1, gpt-5.1-chat-latest, gpt-5.2 and gpt-5.2-chat-latest. #1300, #1317
  • When fetching URLs as fragments using llm -f URL, the request now includes a custom user-agent header: llm/VERSION (https://llm.datasette.io/). #1309
  • Fixed a bug where fragments were not correctly registered with their source when using llm chat. Thanks, Giuseppe Rota. #1316
  • Fixed some file descriptor leak warnings. Thanks, Eric Bloch. #1313
  • Type annotations for the OpenAI Chat, AsyncChat and Completion execute() methods. Thanks, Arjan Mossel. #1315
  • The project now uses uv and dependency groups for development. See the updated contributing documentation. #1318

That last bullet point about uv relates to the dependency groups pattern I wrote about in a recent TIL. I'm currently working through applying it to my other projects - the net result is that running the test suite is as simple as doing:

git clone https://github.com/simonw/llm
cd llm
uv run pytest

The new dev dependency group defined in pyproject.toml is automatically installed by uv run in a new virtual environment which means everything needed to run pytest is available without needing to add any extra commands.

Tags: projects, python, ai, annotated-release-notes, generative-ai, llms, llm, uv

Devstral 2

10 décembre 2025 à 00:58

Devstral 2

Two new models from Mistral today: Devstral 2 and Devstral Small 2 - both focused on powering coding agents such as Mistral's newly released Mistral Vibe which I wrote about earlier today.
  • Devstral 2: SOTA open model for code agents with a fraction of the parameters of its competitors and achieving 72.2% on SWE-bench Verified.
  • Up to 7x more cost-efficient than Claude Sonnet at real-world tasks.

Devstral 2 is a 123B model released under a janky license - it's "modified MIT" where the modification is:

You are not authorized to exercise any rights under this license if the global consolidated monthly revenue of your company (or that of your employer) exceeds $20 million (or its equivalent in another currency) for the preceding month. This restriction in (b) applies to the Model and any derivatives, modifications, or combined works based on it, whether provided by Mistral AI or by a third party. [...]

Mistral Small 2 is under a proper Apache 2 license with no weird strings attached. It's a 24B model which is 51.6GB on Hugging Face and should quantize to significantly less.

I tried out the larger model via my llm-mistral plugin like this:

llm install llm-mistral
llm mistral refresh
llm -m mistral/devstral-2512 "Generate an SVG of a pelican riding a bicycle"

Bicycle looks a bit like a cybertruck

For a ~120B model that one is pretty good!

Here's the same prompt with -m mistral/labs-devstral-small-2512 for the API hosted version of Devstral Small 2:

A small white pelican on what looks more like a child's cart.

Again, a decent result given the small parameter size. For comparison, here's what I got for the 24B Mistral Small 3.2 earlier this year.

Tags: ai, generative-ai, llms, llm, mistral, pelican-riding-a-bicycle, llm-release, janky-licenses

Microsoft présente Phi-3, la nouvelle génération de ses modèles de langage de petite taille

25 avril 2024 à 10:30

Les grands modèles de langage (LLM) présentent des capacités impressionnantes dans différents domaines mais les modèles plus petits (SLM) sont une alternative intéressante pour les entreprises qui peuvent les exploiter à moindre coût pour des tâches spécifiques. Microsoft, qui a introduit le SLM Phi-1 en juin 2023, a présenté le 23 avril dernier la famille de modèles ouverts Phi-3. Le plus petit d’entre eux, Phi-3 mini, d’ores et déjà disponible, compte 3,8 milliards de paramètres et, grâce à sa petite taille, peut être déployé en local sur un téléphone ou un ordinateur.

Microsoft présente les modèles Phi-3 comme “les modèles de langage de petite taille les plus performants et les plus rentables disponibles”.

Phi-3 Mini est un modèle de transformateur avec décodeur dense, affiné grâce au fine-tuning supervisé (SFT) et l’optimisation directe des préférences (DPO) pour garantir l’alignement avec les préférences humaines et les directives de sécurité. Il est disponible sur Azure AI StudioHugging Face et Ollama.

Il a été entraîné pendant sept jours sur 512 GPU NVIDIA H100 Tensor Core, NVIDIA nous a d’ailleurs précisé qu’il était possible de l’essayer sur ai.nvidia.com où il sera packagé en tant que NVIDIA NIM, “un microservice avec une interface de programmation d’application standard qui peut être déployé n’importe où”.

Dans leur rapport technique, les chercheurs expliquent que “L’innovation réside entièrement dans notre jeu de données pour l’entraînement, une version agrandie de celle utilisée pour PHI-2, composé de données web fortement filtrées et de données synthétiques“.

Le modèle, entraîné sur 3,3 trillions de jetons, a également été aligné pour la robustesse, la sécurité et le format de chat. Sa fenêtre contextuelle, qui peut aller de 4 000 jusqu’à 128 000 jetons, lui permet d’assimiler et de raisonner sur des contenus textuels volumineux (documents, pages Web, code…). Selon Microsoft, Phi-3-mini démontre de solides capacités de raisonnement et de logique, ce qui en fait un bon candidat pour les tâches analytiques.

Des performances solides malgré une petite taille

Microsoft a partagé dans son blog les performances de Phi-3 mini, mais également celles de Phi-3-small (7B) et Phi-3-medium (14B) qui seront prochainement disponibles et ont été entraînés sur 4,8 trillions de tokens.

Les performances des modèles Phi-3 ont été comparées à celles de Phi-2, Mistral-7b, Gemma-7B, Llama-3-instruct-8b, Mixtral-8x7b, GPT-3.5 Turbo et Claude-3 Sonnet. Tous les chiffres déclarés sont produits avec le même pipeline afin qu’ils soient effectivement comparables.

Phi-3-mini surpasse Gemma-7B et Mistral-7B sur certains benchmarks de référence comme MMLU, tandis que Phi-3-small et Phi-3-medium, nettement plus performants, surpassent les modèles beaucoup plus grands, y compris GPT-3.5 Turbo.  Cependant, du fait de leur petite taille, les modèles Phi-3 sont moins compétitifs pour les tâches axées sur les connaissances factuelles, telles que celles évaluées dans TriviaQA.

Toutefois, leurs capacités dans de nombreux autres domaines, les rendent particulièrement utiles dans des scénarios où la taille du modèle et les ressources disponibles sont des facteurs critiques, comme dans les environnements à ressources limitées ou les applications nécessitant des temps de réponse rapides.

Microsoft-presente-Phi-3

PyTorch dévoile Torchtune pour fine-tuner les LLM

Par : Korben
19 avril 2024 à 10:18

PyTorch, le framework chouchou des bidouilleurs d’IA, vient de nous pondre un petit truc cool : Torchtune ! 💎 Cette nouvelle bibliothèque native, encore en phase alpha mais déjà disponible en open-source sur GitHub, va vous permettre de fine-tuner les gros modèles de langage (LLM) comme un pro, sans vous prendre la tête.

Torchtune est donc une boîte à outils hyper flexible et modulaire qui va vous permettre de vous éclater à customiser des modèles pour vos propres besoins, le tout avec des recettes mémoire efficaces qui tournent même sur une bête carte graphique de gamer, comme les NVidia 3090/4090.

Son secret ?

Une architecture bien pensée qui mise sur l’interopérabilité avec l’écosystème des LLM, qu’ils soient open-source ou non. Concrètement, ça veut dire que vous allez pouvoir brancher Torchtune à tout un tas d’outils et de frameworks que vous adorez déjà, comme Hugging Face 🤗, PyTorch FSDP 🪢, Weights & Biases 📈, et plein d’autres.

Grâce à des recettes simples et bien documentées pour les modèles populaires comme Llama 3, Mistral ou Gemma 7B, même les débutants vont pouvoir se lancer dans l’aventure sans flipper. Bon OK, il faudra quand même un peu de bagage en PyTorch et en LLM, mais rien d’insurmontable ! Et si vous êtes un pro, vous allez pouvoir hacker le code à volonté pour l’adapter à vos besoins spécifiques.

Alors comment on met les mains dans le cambouis avec Torchtune ?

Rien de plus simple, mon cher Watson ! Il vous suffit d’installer la dernière version stable de PyTorch (2.2.2 au moment où j’écris ces lignes), puis de télécharger Torchtune depuis PyPI avec un petit

pip install torchtune

Et voilà, vous êtes prêt à en découdre avec les LLM !

Pour vous faire les dents, je vous conseille de jeter un œil au tutoriel sur le fine-tuning de Llama2 7B. C’est le parfait point de départ pour comprendre comment Torchtune fonctionne et comment l’utiliser pour vos propres projets.

En gros, ça se passe en 4 étapes :

  1. Téléchargez le modèle pré-entraîné et le tokenizer depuis Hugging Face Hub avec tune download.
  2. Choisissez une recette de fine-tuning (LoRA, QLoRA, full…) et customisez-la avec un fichier de config en YAML.
  3. Lancez l’entraînement avec tune run en précisant votre recette et votre config. Vous pouvez même faire du multi-GPU avec torchrun !
  4. Admirez le résultat et testez votre modèle fine-tuné avec une inférence locale. Si tout se passe bien, exportez-le avec ExecuTorch pour le déployer en prod, ou utilisez les API de quantification de Torchao pour l’exporter en int4 ou int8 et l’utiliser sur mobile ou en edge.

Facile, non ? 😄

Bon OK, j’avoue, j’ai un peu simplifié. En vrai, il y a pas mal de subtilités et de paramètres à régler pour obtenir les meilleurs résultats, comme le learning rate, le nombre d’époques, la taille du batch, le ratio de LoRA, et tout un tas d’autres trucs, mais c’est justement sa flexibilité qui vous permet d’expérimenter à l’infini pour trouver la combinaison parfaite.

Bref, si vous êtes dev et que vous aimez jouer avec les LLM c’est à tester.

Source

Débloquer la puissance de l’IA mobile

5 avril 2024 à 10:00

Si les appareils mobiles ont considérablement évolué depuis le premier iPhone, ils n’ont toujours pas la puissance de calcul nécessaire pour exploiter pleinement les grands modèles de langage (LLM) contemporains. La solution pour maximiser le potentiel de l’IA sur mobile et en périphérie ne réside pas dans la puissance de calcul pure, mais dans une approche stratégique de l’architecture du modèle, de la gestion des données et de l’exploitation des capacités de calcul issues d’un appareil.

Un cloud indépendant pour l’IA mobile

Une véritable IA mobile ne peut pas dépendre uniquement de solutions basées sur le cloud. Il ne s’agit pas seulement d’une question de connectivité, mais aussi d’efficacité, de rapidité et de confidentialité des données. L’IA qui repose sur la transmission de données à un serveur central ne peut pas répondre en temps réel. La latence introduit des lenteurs qui compromettent la fiabilité des informations générées par l’IA, sans compter les coûts de bande passante associés à la transmission constante des données.

Les serveurs cloud sont la solution appropriée pour les applications de calcul puissant, comme l’entraînement des modèles d’apprentissage profond et des LLM. À l’inverse, les opérations nécessitant une interaction immédiate entre l’IA et les utilisateurs, ainsi que d’autres processus de Machine Learning, sont traitées plus efficacement sur l’appareil, à la périphérie du réseau. Cette approche améliore les performances tout en garantissant la confidentialité des utilisateurs grâce à une simplification de la transmission des données.

L’optimisation de la performance sur les appareils mobiles

Réduire la charge de calcul de l’appareil est une autre étape critique. Des techniques comme la quantification des modèles (« quantization » en anglais) qui simplifie les modèles d’IA en optimisant ses paramètres pour réduire l’espace de stockage requis sont essentielles pour maintenir les performances sans compromettre la fonctionnalité. Le GPTQ, qui compresse les modèles après l’entraînement, LoRA, qui affine les matrices plus petites au sein d’un modèle préentraîné, et QLoRA, qui optimise l’utilisation de la mémoire du GPU pour une plus grande efficacité, représentent des options destinées à satisfaire les besoins spécifiques de chaque application.

Confidentialité, sécurité et synchronisation des données

La confidentialité, la sécurité et la synchronisation des données sont d’autres facteurs et éléments clés à prendre en compte pour le développement de l’IA mobile. La mise en place d’un chiffrement des données solide pour la préservation de la vie privée garantit la protection des informations utilisateurs, ce qui conforte l’un des principaux avantages du traitement des données au niveau local. Parallèlement, des mécanismes de synchronisation des données entre les appareils périphériques et le cloud ou les serveurs centraux garantiront l’intégrité et la cohérence des données sur l’ensemble du réseau.

Une plateforme de données unifiée capable de gérer différents types de données et qui permet aux modèles d’IA d’accéder aux données locales et d’interagir avec elles, à la fois en ligne et hors ligne, représente ainsi un avantage significatif. Cette approche améliore non seulement les performances, mais aussi l’expérience utilisateur en garantissant que les applications d’IA sont réactives, fiables et capables de fonctionner dans divers environnements.

La meilleure architecture pour l’IA mobile — et l’IA en général — est celle qui consiste à minimiser sa complexité. Plus l’architecture est simple, plus elle peut consacrer de puissance à l’IA elle-même, ce qui est particulièrement important dans un environnement mobile.

tribune_éric_delattre

Le Monde signe un partenariat pluriannuel avec OpenAI et se dote d’une charte sur l’IA

15 mars 2024 à 12:30

On savait OpenAI en tractations avec plusieurs médias pour entraîner ses LLM sur leurs publications. En France, c’est avec le journal Le Monde que le premier accord a été signé : OpenAI puisera en toute légalité dans le contenu du quotidien pour entraîner ses modèles et enrichir les réponses de ChatGPT. Le Monde, de son côté, s’assure d’une nouvelle source de revenus tout en protégeant ses droits d’auteur.

Si 2023 a été l’année de l’IA générative, elle a été également celle de batailles judiciaires entre les éditeurs, les écrivains, les artistes et les acteurs de l’IA comme OpenAI, Midjourney ou Meta. OpenAI a d’ailleurs été principalement la cible de plaintes comme en témoigne celle du New York Times fin décembre dernier.

Sachant pertinemment que leurs contenus vont aller enrichir les données sur lesquelles sont entraînés les modèles d’IA, leurs auteurs entendent aujourd’hui ne pas laisser les développeurs engranger des bénéfices sur leur dos sans contrepartie. Ce que ces derniers ont compris : Google a ainsi signé en février un accord de licence avec Reddit d’un montant de 60 millions de dollars annuels pour exploiter son contenu.

OpenAI s’est dit prêt à collaborer avec les éditeurs et les créateurs “afin qu’ils tirent profit d’une technologie IA avancée et d’un nouveau modèle de revenus”.

La start-up a signé un accord avec le groupe de presse allemand Axel Springer après avoir conclu un partenariat avec l’Associated Press en juillet dernier, pour partager certains contenus et technologies d’information et examiner des cas d’utilisation potentiels de l’IA générative dans les produits et services d’actualité. Mercredi, elle a annoncé cet accord avec Le Monde mais également un partenariat avec le groupe espagnol Prisa Media.

L’accord de partenariat Le Monde-OpenAI

Les équipes du Monde vont pouvoir exploiter les technologies d’OpenAI pour développer des projets et des fonctionnalités basées sur l’IA tandis que la start-up utilisera son corpus éditorial.

Louis Dreyfus, Directeur général du Monde, et Jérôme Fenoglio, Directeur du Monde, écrivent :

“L’accord prévoit que les références aux articles du Monde soient mises en évidence et systématiquement accompagnées d’un logo, d’un lien hypertexte et des titres des articles utilisés comme références. Les contenus qui nous sont fournis par les agences de presse et les photographies publiées par Le Monde sont expressément exclus”. 

Tous deux rappellent qu’ils ont été parmi les premiers en France à signer des accords de droits voisins avec Facebook puis Google. Le droit voisin permet, depuis 2019, aux éditeurs de presse de recevoir une rémunération des plateformes du Web utilisant leurs publications datant de moins de deux ans. Le montant de celle-ci est déterminé à la suite de négociations entre éditeur et plateforme, comme dans le cadre de ce partenariat.

Ils ajoutent :

“Nous espérons que cet accord créera un précédent pour notre industrie. Avec cette première signature, il sera plus difficile pour les autres plateformes d’IA de se soustraire ou de refuser de négocier. De ce point de vue, nous sommes convaincus que l’accord est bénéfique pour l’ensemble de la profession”.

Précisant :

“Il va sans dire que ce nouvel accord, comme les précédents que nous avons signés, n’entravera en rien la liberté de nos journalistes d’enquêter sur le secteur de l’intelligence artificielle en général, et sur OpenAI en particulier”.

Une charte sur l’IA

Comme de nombreuses entreprises et éditeurs, Le Monde utilise des outils d’IA au quotidien, notamment l’outil de traduction de DeepL pour son site web et son application en anglais. Le quotidien teste également la transcription orale de ses articles français dans le cadre d’un accord avec Microsoft.

L’éditeur met l’accent sur la nécessité d’une supervision humaine dans l’utilisation de l’IA. Une fois les articles traduits par DeepL, ils sont ainsi relus par des traducteurs professionnels avant de l’être par des journalistes anglophones, ce qui a d’ailleurs permis de créer des emplois.

Sa charte sur l’IA, récemment adoptée, complète sa charte éthique et déontologique et stipule en autres :

“L’intelligence artificielle générative (…) ne peut en aucun cas remplacer les équipes éditoriales”

mais également :

 “L’utilisation de l’IA générative n’est autorisée, que dans des conditions strictement définies, comme outil d’aide à la production éditoriale”. 

Monde-signe-partenariat-pluriannuel-OpenA-charte-IA

IA générative : Anthropic dévoile la 3ème génération de sa famille de modèles Claude

6 mars 2024 à 10:32

Lundi dernier, Anthropic annonçait la dernière itération de sa famille de modèles d’IA générative : Claude 3. Le modèle se décline sous trois versions à l’instar du modèle Gemini de Google : Claude 3 Haiku, Claude 3 Sonnet et Claude 3 Opus, par ordre de performances. Les deux derniers modèles sont d’ores et déjà disponibles dans 159 pays, dont la France, via l’API Claude, Haiku, le plus léger, les y rejoindra prochainement.

Selon Anthropic, les utilisateurs des modèles Claude 3 pourront désormais sélectionner l’équilibre optimal entre intelligence, vitesse et coût pour leur application spécifique.

Claude 3 Haiku est le modèle le plus rapide et le plus économique : 0,25$ par million de tokens (jetons) en entrée et 1,25$ par million de tokens générés, et, selon la société, le plus rentable du marché “pour sa catégorie intelligence”. Il peut lire un article de recherche dense en informations et en données sur arXiv (environ 10 000 jetons) avec des tableaux et des graphiques en moins de trois secondes.

Claude 3 Sonnet, 2 fois plus rapide que Claude 2 et Claude 2.1 avec des niveaux d’intelligence plus élevés, combine performances et vitesse pour des tâches efficaces et à haut débit. Il excellerait dans les tâches exigeant des réponses rapides, comme la récupération de connaissances ou l’automatisation des ventes. Son coût est de 3$ par million de tokens en entrée et 15$ par million de tokens générés.

Claude 3 Opus est le modèle le plus puissant des trois mais également le plus onéreux : 15$ par million de tokens en entrée, 75$ par million de tokens générés. Il peut gérer des analyses complexes, des tâches plus longues comportant plusieurs étapes, des tâches mathématiques et de codage d’ordre supérieur.

Selon Anthropic :

“Il peut naviguer dans des invites ouvertes et des scénarios invisibles avec une fluidité remarquable et une compréhension humaine. Opus nous montre les limites extérieures de ce qui est possible avec l’IA générative”.

Les trois modèles ont une fenêtre contextuelle de 200 000 jetons d’entrée, pouvant aller jusqu’à 1 million pour des cas d’utilisation spécifiques.

Evaluations des performances des modèles Claude 3

Les modèles Claude 3 présentent des capacités accrues en matière d’analyse et de prévision, de création de contenu nuancé, de génération de code et de conversation dans des langues autres que l’anglais comme l’espagnol, le japonais et le français.

Selon les comparaisons d’Anthropic que l’on retrouve dans le tableau ci-dessous, Opus surpasse ses concurrents GPT-4 et Gemini Ultra sur la plupart des benchmarks d’évaluation courants des systèmes d’IA, notamment les connaissances expertes de premier cycle ( MMLU ou Massive Multitask Language Understanding), le raisonnement expert de niveau supérieur (GPQA) et les mathématiques de base (GSM8K).

Pour la start-up, il se rapproche de l’AGI :

“Il présente des niveaux de compréhension et d’aisance quasi-humains sur des tâches complexes, à la pointe de l’intelligence générale”.

Anthropic a tenu à préciser que des scores plus élevés pour un modèle GPT-4T plus récent avaient été rapportés.

Les trois modèles peuvent traiter un large éventail de formats visuels, notamment des photos, des tableaux, des graphiques et des diagrammes techniques. Cependant, ils ne peuvent pas générer d’images, ni traiter d’audio ou de vidéo.

Par rapport aux versions précédentes, ils font preuve d’une compréhension plus nuancée des demandes, et refusent beaucoup moins souvent de répondre à des invites inoffensives. Selon Anthropic, ils sont également beaucoup plus précis et leurs réponses plus fiables. Prochainement, il suffira de pointer sur les citations pour les retrouver dans le document traité par Claude 3.

Outre l’API Claude, Sonnet est également disponible via Amazon Bedrock et en avant-première privée sur Vertex AI Model Garden de Google Cloud, Opus et Haiku le seront également.

Anthropic conclut :

“Nous ne pensons pas que l’intelligence des modèles soit proche de ses limites et nous prévoyons de publier des mises à jour fréquentes de la famille de modèles Claude 3 au cours des prochains mois. Nous sommes également ravis de publier une série de fonctionnalités visant à améliorer les capacités de nos modèles, en particulier pour les cas d’utilisation en entreprise et les déploiements à grande échelle. Ces nouvelles fonctionnalités incluront l’utilisation d’outils (alias appel de fonction), le codage interactif (alias REPL) et des capacités agentiques plus avancées”.

Google, Anthropic et Mistral AI talonnent aujourd’hui OpenAI qui a amélioré les capacités de GPT-4 avec GPT-4 Turbo avec Vision et pourrait prochainement creuser de nouveau l’écart avec GPT-5.

IA générative Anthropic dévoile la 3ème génération de sa famille de modèles Claude

CRAG : une méthode pour améliorer la génération de texte basée sur la récupération de connaissances

20 février 2024 à 13:00

La génération de texte basée sur la récupération de connaissances (RAG) permet aux LLM de produire des textes informatifs et cohérents à partir de sources externes. Cependant, la qualité des textes générés dépend fortement de la pertinence des documents récupérés. Pour pallier à ce problème, des chercheurs proposent une méthode nommée “Corrective Retrieval Augmented Generation” (CRAG), qui améliore considérablement les performances des approches basées sur la RAG, donc la précision et la fiabilité des LLM.

Les avancées récentes dans le domaine des modèles de langage ont permis des progrès significatifs dans la génération automatique de texte. Cependant, ces modèles ne sont pas exempts de défis, notamment en ce qui concerne l’exactitude des informations générées. Lorsque les modèles se basent uniquement sur leurs connaissances internes, acquises au cours de l’entraînement, ils peuvent générer des résultats inexacts ou incohérents.

La Génération Augmentée par Récupération (RAG) a été introduite en 2020 pour améliorer la pertinence des informations produites par les LLM. Elle permet au modèle d’utiliser des sources de données externes pour générer des réponses plus précises et à jour, réduisant ainsi le phénomène d’hallucinations.

Pour l’équipe, composée de chercheurs de l’Université de Science et Technologie de Chine, de l’Université de Californie et de Google Research, “Bien que la génération augmentée de récupération (RAG) soit un complément pratique aux LLM, elle repose fortement sur la pertinence des documents récupérés, ce qui soulève des inquiétudes quant à la façon dont le modèle se comporte si la récupération tourne mal”.

Ils proposent donc la CRAG, ou génération de récupération corrective augmentée, pour améliorer la robustesse de la génération basée sur la RAG en affinant les documents pertinents récupérés et en corrigeant ceux qui sont inexacts avec la recherche sur le Web.

La CRAG combine la RAG avec un mécanisme de correction automatique. Tout d’abord, un évaluateur de récupération léger est utilisé pour estimer la pertinence des documents récupérés par rapport à la requête d’entrée, et déclencher différentes actions de récupération de connaissances selon le degré de confiance : Correct, Ambigu, Incorrect.

Si les réponses sont ambigües ou incorrectes, des recherches sur le web à grande échelle permettent d’enrichir ou corriger les résultats de la RAG.

Les chercheurs ont également conçu un algorithme de décomposition-recomposition pour affiner les informations pertinentes dans les documents récupérés. La méthode est plug-and-play et peut être couplée avec diverses approches basées sur RAG.

Evaluations de la méthode

CRAG a été testé sur quatre jeux de données couvrant diverses tâches de génération :

  • PopQA : un ensemble de données utilisé pour évaluer les modèles de génération de texte sur des tâches de réponse à des questions de format court. Il comprend une collection de questions variées auxquelles les modèles doivent répondre en utilisant des connaissances factuelles ;
  • Bio (Biography) : Le jeu de données Bio est destiné à évaluer les modèles de génération de texte sur des tâches de génération de biographies détaillées. Il contient des informations sur différentes entités, et les modèles doivent générer des biographies précises et informatives sur ces entité ;
  • Pub : un jeu de données utilisé dans le domaine de la santé pour évaluer les modèles de génération de texte sur des tâches de vérification de faits et de réponse à des questions vrai ou faux. Il contient des affirmations sur des sujets liés à la santé, et les modèles doivent déterminer si ces affirmations sont vraies ou fausses ;
  • ARC (Arc-Challenge) : ARC est un ensemble de données composé de questions à choix multiples sur des phénomènes scientifiques de bon sens quotidiens. Les modèles doivent sélectionner la réponse correcte parmi plusieurs choix pour chaque question, en se basant sur leur compréhension du contexte scientifique.

Les expériences couplant CRAG avec RAG standard et Self-RAG démontrent largement sa capacité d’adaptation aux approches basées sur RAG, et celles menées sur les quatre ensembles de données démontrent son applicabilité à travers des tâches de génération de forme courte et longue.

CRAG représente une avancée significative dans le domaine de la génération de texte, permettant d’améliorer la robustesse des modèles de langage et de produire des textes plus précis et plus pertinents. Son adaptabilité à différentes tâches de génération de texte en fait une solution prometteuse pour de nombreuses applications du traitement du langage naturel dans divers domaines.

Références de l’article :

“Corrective Retrieval Augmented Generation”  arXiv :2401.15884v1

AuteursShi-Qi Yan1, Jia-Chen Gu2, Yun Zhu3, Zhen-Hua Ling1
1 : National Engineering Research Center of Speech and Language Information Processing,
University of Science and Technology of China, Hefei, China
2 : Department of Computer Science, University of California, Los Angeles
3 : Google Research

CRAG-methode-ameliorer-generation-texte-recuperation-de-connaissances

MGIE, le modèle d’édition d’images à partir d’invites textuelles d’Apple

9 février 2024 à 10:00

Apple semble combler son retard par rapport à Microsoft, Google ou Meta en matière de GenAI. Après le LLM multimodal Ferret open source présenté en octobre dernier, ses chercheurs ont collaboré avec ceux l’Université de Californie à Santa Barbara pour développer le modèle MGIE (MLLM-Guided Image Editing), qui permet de modifier des images à partir d’instructions textuelles. L’équipe a présenté ses travaux dans un article sur arXiv qui a été sélectionné pour la Conférence internationale sur les représentations de l’apprentissage 2024 (ICLR).

Les modèles de langage multimodaux de grande taille (MLLMs) peuvent comprendre naturellement les images en entrée et fournir des réponses qui tiennent compte de la visualisation, agissant ainsi comme des assistants multimodaux.

Pour trouver une solution au défi rencontré lorsque les instructions données aux modèles d’édition d’image ne sont pas assez détaillées ou précises pour produire les résultats souhaités, MGIE utilise un MLLM et un modèle de diffusion pour dériver des instructions précises et fournir un guidage visuel explicite. En s’appuyant sur l’imagination visuelle, MGIE interprète l’intention derrière les invites ambiguës pour produire rapidement des modifications d’image cohérentes et pertinentes.

Par exemple, il peut comprendre une invite telle que “sain” en se basant sur le contexte pour effectuer des éditions appropriées, comme ajouter des garnitures de légumes à une pizza.

Il est également possible d’ajuster le contraste d’une image, d’en supprimer des éléments  ou d’y en ajouter, et d’effectuer des modifications plus courantes telles que le recadrage, le redimensionnement, la rotation, le retournement et l’ajout de filtres.

Le MLLM est initialisé à partir de LLaVA-7B , tandis que le modèle de diffusion est initialisé à partir de StableDiffusion-v1.5. Les chercheurs mettent ensuite à jour conjointement ces deux modèles pour la tâche spécifique de l’édition d’image.

Vue d’ensemble de l’Édition d’Image Guidée par MLLM (MGIE), qui exploite les MLLMs pour améliorer la modification d’image basée sur les instructions. MGIE apprend à dériver des instructions expressives concises et fournit un guidage explicite lié à la visualisation pour l’objectif visé. Le modèle de diffusion est entraîné conjointement et réalise la modification d’image avec l’imagination latente à travers la tête de modification de manière bout à bout. et montre que le module est entraînable et figé, respectivement.

Evalué sur différents aspects de l’édition d’images, tels que la modification de style Photoshop, l’optimisation globale de la photo et l’altération locale des objets, sur plusieurs jeux de données, MGIE montre des améliorations significatives par rapport aux méthodes de base en termes de métriques automatiques et d’évaluation humaine.

Pour les chercheurs, il permet une retouche d’image raisonnable et peut contribuer à de  futures recherche sur la vision et le langage.

Il est accessible sur GitHub et une démo web sur Hugging Face Spaces.

Références de l’article :

“Guiding instruction-based image editing via multimodal large language models”

arXiv :2309.17102v2

Auteurs :

Tsu-Jui Fu1, Wenze Hu2, Xianzhi Du2, William Yang Wang1, Yinfei Yang2, Zhe Gan2
1Université de Californie à Santa Barbara, 2 Apple

MGIE-modele-edition-images-invites-textuelles-Apple

Large language models aren’t people. Let’s stop testing them as if they were. | MIT Technology Review

Une synthèse intéressante sur le comportement des LLM et l'évaluation de leur "intelligence". Les tests actuels sont à interpréter d'affairement pour les humains et les LLM. La mémorisation pourrait être plus importante pour les seconds et la question de la compréhension du contexte reste incertaine
Permalien
❌
❌