Vue lecture

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.
🔲 ⭐

The Personal AI Greenfield

What forms of pAI—personal AI—are Apple, Mozilla, Google, Meta, Microsoft and the rest not doing?

Let’s look at those first two because they’re at the top of the news LIFO buffer.

Apple Intelligence (“coming in beta this fall*“), announced yesterday, will help you with writing and creating images while giving you less lame answers from Siri. (Which they should re-name. Siri is Apple’s Clippy.) It “can draw on larger server-based models, running on Apple silicon, to handle more complex requests for you while protecting your privacy.” The “larger models” will be white-labeled ChatGPT, plus Apple’s own small language models (SLMs).

Mozilla, which got $400+ million a year from Google (for search in the Firefox browser) starting in 2020, announce on June 3 that they will be Building open, private AI with the Mozilla Builders Accelerator. Jive:

This program is designed to empower independent AI and machine learning engineers with the resources and support they need to thrive. It aims to cultivate a more innovative AI ecosystem, and it’s one of Mozilla’s key initiatives to make AI meaningfully impactful — alongside efforts like Mozilla.ai, the Responsible AI Challenge and the Rise25 Awards.

The Mozilla Builders Accelerator’s inaugural theme is local AI, which involves running AI models and applications directly on personal devices like laptops, smartphones, or edge devices rather than depending on cloud-based services…

We chose Local AI as the theme for the Accelerator’s first cohort because it aligns with our core values of privacy, user empowerment, and open source innovation. This method offers several benefits including:

  • Privacy: Data stays on the local device, minimizing exposure to potential breaches and misuse.
  • Agency: Users have greater control over their AI tools and data.
  • Cost-effectiveness: Reduces reliance on expensive cloud infrastructure, lowering costs for developers and users.
  • Reliability: Local processing ensures continuous operation even without internet connectivity.

Looks to me like both of these are Big AI writ small. It’s “local,” not personal. It’s made to serve your needs with what BigAI offers through APIs. It is still essentially AIaaS (AI as a Service), rather than truly personal AI (pAI): personalized more than personal.

That’s also what I see when I read between the lines at Mozilla’s AI job openings. Take platform engineer. This person will (among other things), “assist in managing and orchestrating workloads across multiple cloud providers.” That’s fine. I’m sure true pAIs will do that too. But most of pAI will be more personal than that. It will deal with the mundanities of your everyday life. Not with coughing up answers that can only come from AIaaSes.

The problem with personalizing AI giant offerings is that they are large language models (LLM) trained on everything that can be crawled on the Internet, plus who knows what else. Not on your truly personal stuff. This is why “prompt engineering” worthy of the noun is ” not for anybody:

Prompt engineering is crucial for deploying LLMs but is poorly understood mathematically. We formalize LLM systems as a class of discrete stochastic dynamical systems to explore prompt engineering through the lens of control theory. We investigate the reachable set of output token sequences $R_y(\mathbf x_0)$ for which there exists a control input sequence $\mathbf u$ for each $\mathbf y \in R_y(\mathbf x_0)$ that steers the LLM to output $\mathbf y$ from initial state sequence $\mathbf x_0$. We offer analytic analysis on the limitations on the controllability of self-attention in terms of reachable set, where we prove an upper bound on the reachable set of outputs $R_y(\mathbf x_0)$ as a function of the singular values of the parameter matrices. We present complementary empirical analysis on the controllability of a panel of LLMs, including Falcon-7b, Llama-7b, and Falcon-40b. Our results demonstrate a lower bound on the reachable set of outputs $R_y(\mathbf x_0)$ w.r.t. initial state sequences $\mathbf x_0$ sampled from the Wikitext dataset. We find that the correct next Wikitext token following sequence $\mathbf x_0$ is reachable over 97% of the time with prompts of $k\leq 10$ tokens. We also establish that the top 75 most likely next tokens, as estimated by the LLM itself, are reachable at least 85% of the time with prompts of $k\leq 10$ tokens. Intriguingly, short prompt sequences can dramatically alter the likelihood of specific outputs, even making the least likely tokens become the most likely ones. This control-centric analysis of LLMs demonstrates the significant and poorly understood role of input sequences in steering output probabilities, offering a foundational perspective for enhancing language model system capabilities.

But all that stuff applies mostly when we’re prompting a big LLM system.

What about using AI in our own lives, where the data that matters most are in our calendars, contacts, financial and health records, our travels, our correspondence (email, chat, whatever)? And how about all the location data we might get from our cars, phone apps, and phone companies? These should be much easier for a pAI to gather, examine, and help us do useful things. Caring about much less data also means a pAI will be less likely to give wrong (hallucinated) answers.

Today the mental frame almost everybody uses for AI is the Big kind, ingesting everything they can get their crawlers on, and munching all of it in giant compute farms. Those systems are great for lots of stuff, but they still don’t deal with personal data listed in the last paragraph.

Not yet, anyway.

Look at it this way. For each of us, there are three data pools:

  1. The entire Net, which is what gets crawled by all the giant LLM operators, plus whatever else they can get their claws on.
  2. One’s personal life, some of which is digitized in useful form (contacts, calendar, mail, stuff in folders inside PCs and attached drives).
  3. Personal data that is in the hands of giants, but is rightfully ours. These include our driving record and driving practices (,recorded by our late model cars and snitched to insurance companies and others), our location data (kept and shared by car and phone carriers to the likes of Google and the feds), our TV viewing habits, (gathered by Google, Amazon, Roku, Apple, etc.).

The pAI greenfield is with the last two.

Tell us who is working on what there, preferably with open source, and not sitting on walled garden silicon.

[Later… ] Since readers told me I had small language models (SLMs) wrong in one of the paragraphs above, and I’m not sure I had them right, I rewrote them out of the piece. I invite readers to post comments to further correct and expand on the subject of pAIs and what they can do.

🔲 ⭐

L’open-data, vecteur de transformation et d’innovation

Pour Numéricité, l’open est vecteur de transformation et d’innovation. La donnée est un actif à haute valeur stratégique. Elle permet de partager et d’interpréter de l’information. Fluidifier la circulation des données et encourager leur ouverture, c’est engager les organisations, publiques comme privées, dans l’adoption d’une culture de la donnée. C’est aussi un gage d’une meilleure transparence et efficacité de l’action publique, dans une logique de gouvernement ouvert. Enfin, c’est faciliter le développement de l’économie numérique en permettant des innovations privées appuyées sur des données publiques ouvertes.

C’est pourquoi les entreprises et les administrations publiques se transforment afin de mieux valoriser ces données et investissent dans la construction et la mise en place d’une stratégie data au service de leur stratégie globale.

Retour sur nos missions phares, traduction concrète de notre offre Transfo-soft !

Afin de faciliter la vie des usagers, citoyens comme entreprises, notre pôle Intelligence juridique et conformité a appuyé l’ouverture des données, comme celles produites par France Chaleur Urbaine ou MaCantine.

Moderniser les SI est un prérequis pour faciliter la circulation de la donnée. Pour cela, nous proposons une expertise d’audit nous permettant de formuler des recommandations d’actions concrètes. L’objectif est d’engager la transformation par les métiers, en améliorant leur process internes ou leur organisation produit par exemple.

Numéricité, c’est une équipe d’hommes et de femmes motivés par l’usage d’un numérique ouvert et responsable pour opérer des transformations. Loin d’être promoteur d’un solutionnisme technologique, nous nous faisons chantres de l’open, facteur de transparence et d’efficacité et d’innovation.

La France a une longue histoire d’amour avec l’open-data, et a forgé une vision particulière, notamment sous l’impulsion d’Etalab. Au travers de nos missions, nous sommes fiers de promouvoir ce numérique public français, cette “Digital French Touch”. Nous dessinons déjà la suite d’Etalab grâce aux anciens de la mission ayant rejoint Numéricité et notre réseau de partenaires, et ne cessons d’interroger l’open au regard des nouvelles dimensions technologiques et réglementaires afin de l’entretenir.

Découvrez nos missions phares de sensibilisation à la culture de la donnée et de transmission de la logique d’État-plateforme.

Nous avons accompagné de nombreux acteurs, territoires et gouvernements dans la concertation, la construction et la priorisation de leurs stratégies data. Un seul impératif : mettre l’humain, que ce soit les métiers, les acteurs économiques et/ou les usagers au cœur de la réflexion.

Pour embarquer ces différents collectifs, qu’ils soient spécialistes ou non de la data, nous disposons d’un large éventail de formats : open-lab, ateliers, entretiens, expérimentations, cas d’usage, datadays, hackathons. Il s’agit là d’une première brique de notre approche produit des stratégies data, visant ensuite à s’interroger sur les données à mobiliser, la gouvernance à constituer, les compétences à renforcer, avant de réaliser des expérimentations à petite échelle pour confirmer les orientations.

Voici quelques exemples emblématiques :

Co-construire une stratégie data et rédiger une feuille de route actionnable et appropriable pour Bruxelles, en se faisant facilitateur d’ateliers de travail thématiques.

Mobiliser le potentiel des datas pour améliorer les mobilités à l’échelle régionale lors d’un hackathon au cours duquel les participants pouvaient répondre aux quatre défis pensés en lien avec la stratégie open data d’Île-de-France Mobilités.

Aligner les différentes parties prenantes du Groupe Vyv sur une position ambitieuse autour de l’ouverture des données assurantielles, qui permette de mettre l’usager au centre de l’utilisation de ces données, en organisant une série d’open-lab.

Accompagner la rédaction de la feuille de route de la Direction du Numérique et de la Modernisation de Nouvelle-Calédonie, en organisant en partenariat avec Atlas Management une série d’ateliers, en proposant un parangonnage des exemples internationaux et en coachant des prototypes (POC) data appuyés sur la donnée.

🔲 ⭐

Rétrospective : les bonnes pratiques d’un produit data partagées auprès de la communauté de Numérique en Commun(s)

Rétrospective de Mathilde Bras, avec les contributions de Cécile Le Guen, Augustin Courtier et Quentin Leroy

Les 19 et 20 octobre 2023, la communauté du numérique d’intérêt général s’est retrouvée à Bordeaux pour sa – désormais traditionnelle – grande réunion : Numérique en Commun(s). Cette année, 5 axes thématiques ont ponctué la programmation : données & territoires, écologie & soutenabilité, éthique & émancipation, communs & souveraineté, médiation & compétences numériques.

L’occasion pour Numéricité, partenaire de l’événement, de proposer plusieurs formats de partage d’expérience et de bonnes pratiques autour de défis qui nous tiennent à coeur : l’acculturation par le produit d’équipes ou d’organisations qui souhaitent se transformer, et la mobilisation du droit, en particulier du RGPD, comme un levier d’accélération des services publics numériques.

Dans cet article rétrospective, Mathilde Bras, Strategy & Innovation Manager chez Numéricité, revient sur les principaux enseignements partagés lors de l’atelier “Meilleures pratiques pour un projet data avec et pour des utilisateurs non tech”, et consolide 5 principes d’action pour des projets et produits data.

 

Entreprendre un projet data, un défi pour des profils techniques et non techniques

J’accompagne et entreprends de multiples projets autour de la donnée, depuis la conception de feuilles de route data jusqu’au développement de services d’exploitation de données métiers. Très souvent, je me retrouve dans une situation où les acteurs du projet ont besoin de parler le même langage, tout en mobilisant leurs propres expertises.

Mon rôle de coach est justement de traduire “le langage” des décideurs, faire remonter les besoins des utilisateurs auprès des équipes produit, être médiatrice des besoins opérationnels, et aussi de faciliter l’identification collective de points de passage. Cela se traduit concrètement par la définition des premières orientations du produit, l’identification des parties prenantes à associer, mais aussi la manière de mobiliser les utilisateurs, le mode de communication sur le produit, les risques potentiels, les compétences à mobiliser, etc.

Pour Numérique en Communs, j’ai donc proposé un exercice ouvert d’introspection à plusieurs porteurs d’initiatives liées à la valorisation des données publiques, qu’elles soient partagées en open data ou entre administrations :

En racontant nos expériences aux participants de l’atelier, nous avons pu partager des défis communs lorsqu’il s’agit de construire des produits qui se fondent sur l’exploitation de données. Leur similitude : à chaque étape, il est important de transformer des idées reçues en opportunités pour faire avancer son projet. Quelques exemples partagés pendant l’échange (nous avons partagé des exemples fictifs, mais inspirés de la réalité) :

  • J’ai besoin de 5 data-scientists pour réaliser le projet, rien d’autre” : en réalité, un projet data nécessite de s’intéresser à une pluralité de profils, tech et non tech. Une personne spécialisée en droit du numérique peut vous être utile, tout comme des compétences capables de traduire le besoin du métier en parcours (les UX designers)
  • Je sais déjà ce que je souhaite développer, pas besoin de s’adresser aux futurs utilisateurs” : en réalité, en vous adressant aux utilisateurs, vous allez pouvoir considérer l’usage des données comme un intrant pour sa structuration et sa mise en qualité. Dans le cas d’un produit data, il peut s’agir des producteurs de données, des réutilisateurs (techniques et métiers), et de décideurs (dans le cas d’un tableau de bord par exemple)
  • Le droit ne nous permet pas d’exploiter ces données, on ne peut les intégrer au prototype, il faut attendre la mise en production et l’homologation” : le fait de se poser des questions juridiques dès le démarrage du projet peut aussi être un levier pour transformer la gouvernance d’un projet, d’une politique publique ou d’une base de données
  • Commandons un logiciel sur étagère, ce sera plus simple dans la durée” : considérer la force de l’open-source est la clef. Il existe aujourd’hui des librairies très riches en matière d’exploitation et de transformation de données, tout comme d’applications de cartographie ou visualisation
  • Apprendre à des personnes non spécialisées en données à les réutiliser ne sert à rien” : bien au contraire, cela peut constituer un réel outil d’acculturation sur la manière dont les données sont produites, leur utilité pour prendre des décisions et se représenter le réel, et ainsi créer de l’engagement autour des politiques publiques qu’elles suivent

Photo de l'atelier organisé dans le cadre de NEC2023, à Bordeaux le 19 octobre 2023
Photo de l'atelier organisé dans le cadre de NEC2023, à Bordeaux le 19 octobre 2023

Quelques principes d’action pour développer des produits data avec et pour des utilisateurs non spécialistes de la donnée

Forts de ces témoignages et des questions posées par les participations de l’atelier NEC, nous avons consolidé quelques principes d’action pour guider des personnes travaillant actuellement ou prochainement sur des projets ou produits data, qu’elles aient des compétences “techniques” en données ou non.

Notre livrable pour la communauté Numérique en Communs – 5 principes d’action de projet data en commun(s) :

  • Opérer une médiation constante entre les utilisateurs et les données (et le produit) : avoir accès à une base de données n’est pas l’objectif, c’est seulement un éventuel moyen pour répondre à des besoins “métiers” ou “usagers”. Une ou un responsable de produit data a la mission de garder en tête cette perspective, pour éviter par exemple que le service développé soit uniquement compréhensible – et donc utilisable – par les personnes qui connaissent la donnée par coeur. Concrètement, cela implique de s’intéresser autant à l’utilisation – donc la valeur de la donnée – qu’à sa qualité ;
  • Travailler la gouvernance – technique et organisationnelle – tout au long du projet/produit : lors de la conception, échanger avec les personnes qui produisent, reçoivent, transmettent ou transforment la donnée, non seulement pour les inclure – et mobiliser leur expertise ! – dans les différents temps forts du projet, mais aussi pour identifier les enjeux liés à la qualité de la donnée, qui est la clef de tout projet data. Concrètement, pour le projet PILOTE, cela impliquait de se poser la question du cycle de vie des données : est-ce que je dispose de données ou le projet consiste à aller en chercher ? qui les produit ? qui est responsable des mises à jour, du stockage ? ces données doivent-elles respecter des standards de qualité ? sont-elles sensibles au sens du RGPD ?
  • S’appuyer sur les forces de l’open source – et des communs – pour construire des projets data : les standards publics sont pour cela très inspirants. Tout service public numérique doit rendre son code ouvert (”public money, public code”, vivent les communs !). Au-delà du code produit, aller chercher des briques techniques dans l’état de l’art pour développer de services est souvent gage de qualité. Celles en vogue en ce moment sur les données : VueJS (développement d’applications), Apache Superset (datavisualisation), la suite ELK (import de données, requête, analyse et visualisation), Kubernetess (infrastructure de conteneurisation), Keycloack (identité et gestion des accès). Cela implique bien sûr de réaliser de la veille régulière sur ces briques, leurs mises à jour, et de s’appuyer sur la communauté de contributeurs ! Et on ne peut s’empêcher de citer Onyxia, un environnement de travail à l’état de l’art pour la data, open source et propulsé par les équipes de l’Insee, dont les cas d’usage ne font que se multiplier (voir nos travaux sur le projet DATAFID)
  • Considérer le droit comme une opportunité d’innovation et d’accélération : aujourd’hui de nombreux standards doivent s’appliquer aux services numériques développés par des acteurs publics et des questions de droit (qui vont au-delà des sujets techniques) peuvent se poser tout au long du projet, et même si cela demande du travail, c’est une opportunité ! Lors d’un projet data, on peut se rendre compte que certains textes doivent être harmonisés, ou proposer une nouvelle mouture d’une disposition juridique. Et surtout, on peut aussi imaginer des facilités de prototypage même si notre produit n’a pas été homologué : un exemple concret tout récent, la génération de données “fictives”, qui respecte le schéma des données “réelles”, afin de tester une première version d’application, avant la mise en production (en savoir plus avec le projet CM2D ici)
  • Dépasser les frontières de la documentation (technique) pour en faire une plateforme pour la communauté : si vous avez déjà travaillé dans des équipes produits, vous avez déjà dû entendre râler autour de vous lorsqu’il s’est agi de documenter une application ou un service. En réalité, documenter un produit peut en faciliter son adoption, inspirer des utilisateurs sur des usages possibles et permettre le déploiement à grande échelle. Concrètement, comme nous l’a raconté Quentin pour ChartsGouv, cela implique – bien sûr – de publier le code, les informations d’installation (comme un mode d’emploi) et d’aller plus loin en répertoriant des cas d’usages et en réunissant régulièrement la communauté. Dans le cas de l’Open Data University, c’est plus que de la documentation, c’est un plaidoyer sur la vertu pédagogique de l’open data enseigné au sein de multiples formations : qui engagent les étudiantes et étudiants à s’intéresser non seulement aux données publiques, mais aussi au secteur public en général !

Ces principes ne sont pas exhaustifs, nous espérons qu’ils pourront guider le plus grand nombre ! N’hésitez pas à nous faire part de vos retours d’expérience par mail : communication@numericite.eu !

❌