Vue normale

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.
À partir d’avant-hierActuIA

Microsoft présente Phi-3, la nouvelle génération de ses modèles de langage de petite taille

25 avril 2024 à 10:30

Les grands modèles de langage (LLM) présentent des capacités impressionnantes dans différents domaines mais les modèles plus petits (SLM) sont une alternative intéressante pour les entreprises qui peuvent les exploiter à moindre coût pour des tâches spécifiques. Microsoft, qui a introduit le SLM Phi-1 en juin 2023, a présenté le 23 avril dernier la famille de modèles ouverts Phi-3. Le plus petit d’entre eux, Phi-3 mini, d’ores et déjà disponible, compte 3,8 milliards de paramètres et, grâce à sa petite taille, peut être déployé en local sur un téléphone ou un ordinateur.

Microsoft présente les modèles Phi-3 comme “les modèles de langage de petite taille les plus performants et les plus rentables disponibles”.

Phi-3 Mini est un modèle de transformateur avec décodeur dense, affiné grâce au fine-tuning supervisé (SFT) et l’optimisation directe des préférences (DPO) pour garantir l’alignement avec les préférences humaines et les directives de sécurité. Il est disponible sur Azure AI StudioHugging Face et Ollama.

Il a été entraîné pendant sept jours sur 512 GPU NVIDIA H100 Tensor Core, NVIDIA nous a d’ailleurs précisé qu’il était possible de l’essayer sur ai.nvidia.com où il sera packagé en tant que NVIDIA NIM, “un microservice avec une interface de programmation d’application standard qui peut être déployé n’importe où”.

Dans leur rapport technique, les chercheurs expliquent que “L’innovation réside entièrement dans notre jeu de données pour l’entraînement, une version agrandie de celle utilisée pour PHI-2, composé de données web fortement filtrées et de données synthétiques“.

Le modèle, entraîné sur 3,3 trillions de jetons, a également été aligné pour la robustesse, la sécurité et le format de chat. Sa fenêtre contextuelle, qui peut aller de 4 000 jusqu’à 128 000 jetons, lui permet d’assimiler et de raisonner sur des contenus textuels volumineux (documents, pages Web, code…). Selon Microsoft, Phi-3-mini démontre de solides capacités de raisonnement et de logique, ce qui en fait un bon candidat pour les tâches analytiques.

Des performances solides malgré une petite taille

Microsoft a partagé dans son blog les performances de Phi-3 mini, mais également celles de Phi-3-small (7B) et Phi-3-medium (14B) qui seront prochainement disponibles et ont été entraînés sur 4,8 trillions de tokens.

Les performances des modèles Phi-3 ont été comparées à celles de Phi-2, Mistral-7b, Gemma-7B, Llama-3-instruct-8b, Mixtral-8x7b, GPT-3.5 Turbo et Claude-3 Sonnet. Tous les chiffres déclarés sont produits avec le même pipeline afin qu’ils soient effectivement comparables.

Phi-3-mini surpasse Gemma-7B et Mistral-7B sur certains benchmarks de référence comme MMLU, tandis que Phi-3-small et Phi-3-medium, nettement plus performants, surpassent les modèles beaucoup plus grands, y compris GPT-3.5 Turbo.  Cependant, du fait de leur petite taille, les modèles Phi-3 sont moins compétitifs pour les tâches axées sur les connaissances factuelles, telles que celles évaluées dans TriviaQA.

Toutefois, leurs capacités dans de nombreux autres domaines, les rendent particulièrement utiles dans des scénarios où la taille du modèle et les ressources disponibles sont des facteurs critiques, comme dans les environnements à ressources limitées ou les applications nécessitant des temps de réponse rapides.

Microsoft-presente-Phi-3

AWS annonce la disponibilité d’Amazon Bedrock en France

4 avril 2024 à 10:30

C’est lors de l’AWS Summit Paris 2024, que Julien Groues (General Manager – Europe South, AWS) a annoncé hier l’arrivée en France d’Amazon Bedrock, un service qui permet de créer et de mettre à l’échelle des applications d’IA génératives à l’aide de modèles de fondation. Il donne désormais accès au dernier modèle de Mistral AI, Mistral Large, ainsi qu’à Claude 3 Haiku et Claude 3 Sonnet d’Anthropic.

Lancé en avril 2023, Amazon Bedrock permet à ses utilisateurs de personnaliser des LLM en fonction de leurs besoins et de leurs données au lieu d’utiliser des modèles prêts à l’emploi. A l’origine, ceux-ci avaient le choix entre les modèles de fondation des start-ups AI21 LabsAnthropic, Stability AI et les modèles Titan d’Amazon, Titan Text Lite et Titan Text Express. En septembre dernier, AWS enrichissait ce service avec l’ajout de Claude 2 d’Anthropic, Stable Diffusion XL 1.0 de Stability AI, le modèle phare “Command” de la start-up canadienne Cohere ainsi que son modèle “Embed”.

Après Mistral 7B et Mixtral 8x7B il y a quelques semaines, c’est au tour de Mistral Large de les y rejoindre avec les derniers modèles d’Anthropic.

AWS souligne qu’aucune des données du client n’est utilisée pour former les modèles sous-jacents, et comme toutes les données sont chiffrées et ne quittent pas le Virtual Private Cloud (VPC) d’un client, les clients peuvent être sûrs que leurs données resteront privées et confidentielles. Le service est facturé en fonction de son utilisation.

Lors de la keynote de cette conférence dédiée au cloud, à la data et l’IA, Julien Groues, accompagné de Mai-Lan Tomsen-Bukovec (VP of Technology, AWS), a expliqué comment les technologies AWS permettent aux clients de tirer parti de la puissance de l’IA générative. Après les témoignages clients de Fabien Mangeant (Chief Data and AI Officer, Air Liquide) et Raphaëlle Deflesselle (CTO, Groupe TF1), Arthur Mensch (cofondateur et CEO, Mistral AI), est monté sur scène où il a expliqué que la plateforme d’AWS est un canal de distribution particulièrement efficace. Thomas Wolf (cofondateur de Hugging Face) et Tom Brown (cofondateur d’Anthropic), deux start-ups qui ont bénéficié des investissements d’Amazon, Hugging Face lors de sa dernière levée de fonds, et Anthropic dans le cadre d’une collaboration élargie avec le géant du cloud qui pourrait lui rapporter jusqu’à 4 milliards, sont également intervenus.

Les 3 cofondateurs ont rappelé l’importance de l’infrastructure cloud d’AWS qui leur donne un accès aux puces AWS Trainium et Inferentia, conçues pour accélérer l’entraînement des modèles d’IA, améliorer le temps d’inférence et réduire les coûts.

AWS annonce la disponibilité d'Amazon Bedrock en France

Comment Ai2 démocratise la recherche sur les LLM avec OLMo (Open Language Model)

6 février 2024 à 13:30

L’Allen Institute for Artificial Intelligence (Ai2), organisation à but non lucratif, a été créé en 2014 par Paul Allen, co-fondateur de Microsoft dans le but de participer activement au développement de l’intelligence artificielle pour le bien commun. Il franchit un pas décisif dans cette direction avec la publication du LLM OLMo. Alors que certains modèles open source incluent les codes et les poids, Ai2 rend le modèle OLMo véritablement ouvert en fournissant non seulement les codes et les poids, mais aussi le code d’entraînement, les données d’entraînement et les boîtes à outils associées, le tout sous licence Apache 2.0.

Avec la publication du modèle de pointe OLMo et du cadre qui l’accompagne, l’objectif d’Ai2 est de favoriser l’innovation et la collaboration sur les modèles de langage, tout en sensibilisant aux enjeux éthiques et sociétaux qu’ils soulèvent.

Hanna Hajishirzi, Cheffe de projet OLMo, Directrice principale de la recherche en NLP à AI2 et professeure à l’Allen School de l’UW, explique:

“De nombreux modèles de langage sont aujourd’hui publiés avec une transparence limitée. Sans avoir accès aux données d’entraînement, les chercheurs ne peuvent pas comprendre scientifiquement le fonctionnement d’un modèle. C’est l’équivalent de la découverte de médicaments sans essais cliniques ou de l’étude du système solaire sans télescope. Grâce à notre nouveau cadre, les chercheurs seront enfin en mesure d’étudier la science des LLM, ce qui est essentiel pour construire la prochaine génération d’IA sûre et digne de confiance”.

OLMo est le fruit d’une collaboration avec le Kempner Institute for the Study of Natural and Artificial Intelligence de l’Université Harvard et des partenaires tels qu’AMD, CSC, la Paul G. Allen School of Computer Science & Engineering de l’Université de Washington et Databricks.

Les modèles OLMo 7B et 1B ont été développés sur le supercalculateur LUMI du CSC (Centre de technologie de l’information pour la science), alimenté par des processeurs AMD EPYC™ et des accélérateurs AMD Instinct™ et ont été entraînés grâce à la plateforme MosaicML de Datbricks.

Le cadre comprend une suite d’outils de développement d’IA entièrement ouverts, notamment :

  • Données de pré-entraînement complètes : le modèle est construit sur l’ensemble Dolma d’AI2 qui comprend un corpus ouvert de trois billions de jetons pour le pré-entraînement du modèle de langage, y compris le code qui produit les données d’apprentissage.
  • Le cadre OLMo comprend des pondérations de modèle complètes pour quatre variantes de modèle à l’échelle 7B, chacune entraînée à au moins 2T tokens. Le code d’inférence, les métriques d’entraînement et les journaux d’entraînement sont tous fournis.
  • Evaluation : Ai2 a publié la suite d’évaluation utilisée dans le développement, avec plus de 500 points de contrôle par modèle, toutes les 1000 étapes du processus de formation et le code d’évaluation sous l’égide du projet Catwalk.

Eric Horvitz, directeur scientifique de Microsoft et membre fondateur du conseil consultatif scientifique d’AI2, déclare :

“Je suis enthousiaste à l’idée de mettre OLMo entre les mains des chercheurs en IA. La nouvelle offre s’inscrit dans la tradition d’Allen AI de fournir des modèles, des outils et des données ouverts de valeur, qui ont stimulé de nombreuses avancées dans le domaine de l’IA dans la communauté mondiale”.

Avec OLMo, les chercheurs et développeurs en IA feront l’expérience de :

  • Plus de précision : Grâce à une connaissance complète des données d’entraînement qui sous-tendent le modèle, les chercheurs seront en mesure de travailler plus rapidement et n’auront plus besoin de dépendre d’hypothèses qualitatives sur la façon dont le modèle fonctionne, mais pourront le tester scientifiquement.
  • Moins de carbone : À l’heure actuelle, une séance d’entraînement équivaut aux émissions de neuf foyers américains pendant un an, selon l’EPA, l’agence américaine de protection de l’environnement. En offrant un accès complet à l’écosystème de formation et d’évaluation, Ai2 diminue considérablement les répétitions dans le processus de développement, ce qui est crucial pour la réduction des émissions de carbone dans le domaine de l’intelligence artificielle.
  • Des résultats durables : Le fait de garder les modèles et leurs ensembles de données ouverts et non derrière les API permet aux chercheurs d’apprendre et de s’appuyer sur des modèles et des travaux antérieurs.

Ai2 prévoit d’ajouter prochainement différentes tailles de modèles, modalités, ensembles de données et capacités à la famille OLMo.

Noah Smith, chef de projet OLMo, directeur principal de la recherche en NLP à AI2 et professeur à l’Allen School de l’UW, conclut :

“Avec OLMo, ouvert signifie en fait « ouvert » et tous les membres de la communauté de recherche en IA auront accès à tous les aspects de la création de modèles, y compris le code d’entraînement, les méthodes d’évaluation, les données, etc…L’IA était autrefois un domaine ouvert centré sur une communauté de recherche active, mais à mesure que les modèles se sont développés, sont devenus plus chers et ont commencé à se transformer en produits commerciaux, le travail sur l’IA a commencé à se dérouler derrière des portes closes. Avec OLMo, nous espérons aller à l’encontre de cette tendance et donner à la communauté des chercheurs les moyens de se réunir pour mieux comprendre et s’engager avec les modèles de langage de manière scientifique, ce qui conduira à une technologie d’IA plus responsable qui profite à tous”.

Le modèle OLMo et son framework sont accessibles en téléchargement direct sur Hugging Face et GitHub.

Comment-Ai2-democratise-recherche-LLM-avec-OLMo

❌
❌