← Retour au cours
🧭

Prise en main : les outils, les données

CM 13hjeudi 24 sept. 2026 · 9h30–12h30

Statistiques et marketing
Présentation
Quatre façons de connaître le client 1936 1974 1995 2012 Demander Observer Identifier Tester le sondage le code-barres la carte de fidélité l'expérience en ligne Gallup Troy, Ohio Tesco Clubcard Bing
Quatre jalons de la connaissance du client : on l'interroge, puis on enregistre ses achats, puis on les relie à son nom, enfin on teste sur lui. L'expérience de Bing date de 2012, l'article qui la raconte de 2017. Sources : Wikipédia, George Gallup ; Smithsonian Magazine ; Wikipédia, Tesco ; Harvard Business Review.
Demander : le sondage

En 1936, le magazine Literary Digest recueille environ 2,4 millions de réponses et annonce la défaite de Roosevelt. George Gallup, avec un échantillon d'environ 50 000 personnes choisies, annonce sa victoire.

Roosevelt l'emporte avec 61 % des voix.

Ce n'est pas la taille de l'échantillon qui compte, c'est sa construction.

Les enquêtes, vous les verrez en détail avec Charlotte Lécuyer.

Observer : le code-barres

Le 26 juin 1974, dans un supermarché de Troy, dans l'Ohio, le premier code-barres est scanné en caisse, sur un paquet de chewing-gums Wrigley's (Smithsonian Magazine).

On ne demande plus aux gens ce qu'ils achètent, on l'enregistre en caisse : c'est la naissance des panels de ventes.

Identifier : la carte de fidélité

En 1995, Tesco lance la Clubcard, dont les données sont analysées par dunnhumby.

Pour la première fois, chaque ticket de caisse a un nom, et l'on peut suivre un client d'un achat à l'autre.

Tester : l'expérience en ligne

Chez Bing, un changement dans l'affichage des titres d'annonces, testé sur une partie des utilisateurs, a augmenté les revenus de 12 %, soit plus de 100 millions de dollars par an aux États-Unis (Kohavi et Thomke, Harvard Business Review, 2017).

On ne se demande plus ce qui marcherait : on le teste, sur des millions de personnes, en quelques jours.

Les métiers de l'étude aujourd'hui

Au 23 septembre 2026, la base du cours compte 268 offres actives de chargé(e) d'études commerciales sur France Travail.

Le mot « questionnaire » n'apparaît que dans 2 d'entre elles, « statistique » dans 10.

Les outils : du papier à Claude Code
Présentation
Qui fait le calcul ? Vous papier et crayon Le logiciel répond à vos clics Votre code vous l'écrivez L'agent vous lui décrivez Papier, crayon SPSS Excel jamovi R Google Colab Claude Code test t, 1908 1968 1985 2017 1993 2017 2025
Les sept outils du cours, rangés selon qui fait le calcul, avec leur année d'apparition. Source : Wikipédia (test de Student, SPSS, Excel, R, Google Colab), blog jamovi, Anthropic.
Le papier et le crayon

Jusqu'aux années 1960, les statistiques se calculent à la main, avec des tables imprimées.

Le test t est né ainsi : William Gosset le publie en 1908 sous le pseudonyme « Student », alors qu'il contrôle chez Guinness la qualité de l'orge et de la bière.

C'est encore la meilleure façon de comprendre ce que fait un calcul, et ce sera le format du QCM.

Excel

Le tableur que tout le monde a, né en 1985 : on voit la base, et un tableau croisé dynamique se fait en trois clics.

Dans la base du cours, 49 des 268 offres de chargé(e) d'études citent Excel, aucune ne cite SPSS.

Mais une base nettoyée à la main ne se refait pas.

SPSS

Le logiciel historique des études et des sciences sociales, né en 1968, racheté par IBM en 2009 : on clique dans des menus, il sort des tableaux.

Payant et fermé ; c'était l'outil de ce cours jusqu'à l'an dernier.

R

Le langage libre et gratuit des statisticiens : tout ce qui existe en statistique existe en R.

Le prix à payer : il faut écrire du code, et la marche est haute au départ.

jamovi

Des menus comme SPSS, mais jamovi est gratuit et construit sur R : les résultats se mettent à jour pendant qu'on coche.

Parfait pour apprendre les tests, vite limité dès que la donnée est sale.

Google Colab

Python dans le navigateur, rien à installer, un compte Google suffit : dans Colab, le code, les résultats et le texte tiennent dans le même carnet.

On passe du clic au code, et le code se rejoue, se partage, se corrige.

Claude Code

On ne clique plus et on n'écrit plus le code soi-même : on décrit ce qu'on veut, l'agent écrit, lance, corrige.

Payant, conseillé, pas imposé : la démo dira pourquoi, et libre à vous de tester autre chose si c'est aussi efficace.

Les bases de la culture numérique
Présentation
https:// vincentfavarin.github.io /metier/ l'URL : une adresse protocole serveur chemin Votre ordinateur navigateur ou programme Serveur allumé en permanence demande (HTTP) câbles et protocoles (TCP/IP) réponse : une page HTML (navigateur) ou des données JSON (API) DNS nom → adresse IP lit Base de données
Le trajet d'une demande : votre ordinateur demande une ressource à un serveur par son URL ; le serveur lit sa base de données et renvoie une page HTML, que le navigateur dessine, ou des données, qu'un programme lit. Source : schéma de l'auteur, sur l'exemple du site metier.
Internet : des serveurs et des câbles

Internet, ce sont des ordinateurs allumés en permanence, les serveurs, reliés par des câbles.

Environ 99 % du trafic internet international passe par des câbles sous-marins.

Ces machines se parlent selon des règles communes, les protocoles : TCP/IP achemine les données, HTTP sert à demander une page.

L'URL : une adresse

Une URL désigne une ressource sur un serveur.

Elle se lit en trois morceaux : le protocole, le nom du serveur, le chemin, par exemple https://vincentfavarin.github.io/metier/.

Le nom est traduit en adresse numérique par le DNS, l'annuaire d'internet.

Un site, c'est du texte mis en forme

Une page web est un fichier texte écrit en HTML, habillé par du CSS, parfois animé par du JavaScript.

Le navigateur lit ce texte et le dessine.

Le joli design n'est que ça.

Clic droit, « Afficher le code source » : sur n'importe quel site, vous retrouvez ce texte.

Local ou hébergé

Le même fichier peut s'ouvrir depuis votre disque, et vous seul le voyez ; ou être déposé sur un serveur, et tout le monde y accède par une URL.

Le site du dépôt metier est hébergé gratuitement par GitHub Pages ; celui de ce cours, par Hostinger.

Les bases de données

Derrière un site qui change, il y a une base : des tables, faites de lignes et de colonnes, qu'on interroge en SQL.

Vos données arriveront en CSV ou en JSON : du texte, lisible dans n'importe quel éditeur.

Les API : une URL qui répond des données

Une API est une adresse qu'un programme interroge, et qui renvoie des données plutôt qu'une page.

C'est ainsi que le dépôt metier récupère chaque matin les offres de France Travail, et que nous récupérerons les entreprises du 63.

Chaque clic laisse une trace

Un serveur note chaque demande qu'il reçoit : l'heure, la page, l'appareil, d'où vient le visiteur.

C'est de là que viennent la plupart des données marketing : les journaux des serveurs, les cookies, les tickets de caisse, et les offres d'emploi que vous allez analyser.

Le terminal

Le terminal est une fenêtre où l'on parle à l'ordinateur en tapant des commandes plutôt qu'en cliquant.

C'est là que tourne Claude Code.

Pas besoin de connaître les commandes : il faut savoir ce qu'on lui demande.

Python et les autres langages

Python pour les données, R pour les statistiques, SQL pour les bases, JavaScript pour le web.

HTML n'est pas un langage de programmation : il décrit une page.

En 2024, Python est devenu le langage le plus utilisé sur GitHub, devant JavaScript (GitHub, Octoverse 2024).

Le matériel : ce que votre ordinateur peut faire tourner

Le processeur calcule, la mémoire vive tient ce qu'on calcule, la carte graphique calcule en parallèle : c'est elle qui fait tourner une IA.

Sur un petit PC, pas d'IA en local.

Avec une carte graphique récente, ou un Mac à puce M et au moins 32 Go de mémoire, un modèle ouvert peut tourner chez vous.

Colab tourne sur les machines de Google.

Les grands modèles tournent sur des cartes comme la H100 de Nvidia, de l'ordre de 30 000 dollars pièce.

GitHub : l'historique d'un dossier, en ligne

Git enregistre chaque version d'un dossier, avec sa date et son auteur.

GitHub met ces dossiers en ligne, les dépôts, pour les partager ; Microsoft l'a racheté en 2018 pour 7,5 milliards de dollars.

Quatre mots : commit, j'enregistre une version ; push, je l'envoie en ligne ; pull, je récupère la dernière ; fork, je copie le dépôt de quelqu'un pour le faire évoluer.

Le dépôt du cours : metier

github.com/VincentFavarin/metier : 3 363 offres actives au 23 septembre, pour 23 métiers.

Chaque matin à 7 h, GitHub Actions interroge France Travail et GitHub Pages republie le site, ordinateur éteint.

Trois façons de vous l'approprier : prendre les données ; forker le dépôt et ajouter votre métier ; tout relancer chez vous.

Mes données sont un point de départ : un dossier qui s'y limite restera en surface.

IA dans le navigateur ou agentique

Dans le navigateur, avec ChatGPT ou Claude.ai, vous collez un texte et l'IA répond.

C'est à vous de copier le résultat, de le lancer, de le corriger.

Un agent travaille dans un dossier de votre ordinateur : il lit vos fichiers, écrit le code, le lance, voit l'erreur et recommence jusqu'à ce que ça marche.

C'est la différence entre demander un conseil et confier une tâche.

Pour travailler une base de données, c'est l'agent.

IA publique ou privée : trois façons d'avoir un agent

Les modèles ouverts (Llama, Mistral, DeepSeek, Qwen) se téléchargent.

Les modèles privés (Claude, GPT, Gemini) tournent sur les serveurs de leur éditeur.

Votre machine, si elle est assez puissante, avec un modèle ouvert ; une machine louée, un serveur chez Hostinger par exemple ; ou un service privé, Claude Code, le plus simple et le plus efficace.

Ce que vous envoyez à une IA privée quitte votre ordinateur : pas de données personnelles dans un prompt.

L'IA est nulle en maths ?

Fin 2022, ChatGPT se trompe sur des multiplications à quelques chiffres.

L'idée que l'IA est mauvaise en maths vient de là, et beaucoup en sont restés là.

En juillet 2024, AlphaProof et AlphaGeometry 2, de DeepMind, atteignent le niveau médaille d'argent aux Olympiades internationales de mathématiques, avec 28 points sur 42.

En juillet 2025, DeepMind et OpenAI atteignent le niveau médaille d'or, avec 35 sur 42.

Fin 2022 ChatGPT se trompe sur des multiplications Juillet 2024 Niveau argent aux Olympiades DeepMind, 28 sur 42 Juillet 2025 Niveau or aux Olympiades DeepMind et OpenAI, 35 sur 42 Septembre 2026 Navier-Stokes, un problème du millénaire (annonce OpenAI)
De la fin 2022 à septembre 2026 : des erreurs de multiplication de ChatGPT à l'annonce d'une preuve sur l'un des problèmes du millénaire. Source : Google DeepMind, 2024 et 2025 ; Quanta Magazine, 2026.
Septembre 2026 : Navier-Stokes

Le 8 septembre, OpenAI annonce une preuve que les équations de Navier-Stokes, qui décrivent l'écoulement des fluides, peuvent produire une singularité en temps fini.

C'est l'un des problèmes du millénaire, doté d'un million de dollars.

Environ 10 000 agents y ont travaillé, et la preuve a été vérifiée formellement par la machine, dans le langage Lean (Quanta Magazine).

Le prix n'est pas attribué : le Clay Institute attend deux ans après publication.

Le 11 septembre, 25 médaillés Fields, dont Cédric Villani (médaille 2010) et plusieurs autres Français, signent une déclaration contre une course aux problèmes qui contourne la compréhension.

Démonstration : faire grandir la base
Présentation
Offres d'emploi (France Travail) offre contrat salaire commune 63113 63113 Entreprises du 63 (API de l'État) commune entreprise activité effectif 63113 63113 clé : code commune Nouvelle table : les variables face à face offre contrat salaire commune entreprise activité effectif 63113 63113 Croiser : effectif × recrutement, activité × contrat, commune × salaire
Deux tables reliées par une clé commune, le code INSEE de la commune (63113 pour Clermont-Ferrand) ; la nouvelle table ajoute à chaque offre les colonnes de l'entreprise et met leurs variables face à face. Source : schéma de l'auteur, d'après le dépôt metier et l'API Recherche d'entreprises.
Le point de départ

Le point de départ est le dépôt metier : les offres d'emploi de 23 métiers, récupérées chaque matin sur France Travail.

Le site qu'il publie se lit ici : vincentfavarin.github.io/metier.

Une nouvelle source : les entreprises du 63

L'API Recherche d'entreprises de l'État est gratuite et s'interroge sans clé.

Elle donne les entreprises du Puy-de-Dôme, avec leur activité, leur effectif, leur commune.

On la découvre ensemble, en direct : je fais, j'explique ce qui se passe à chaque étape, vous observez.

Croiser

Une source n'apporte que des données : de nouvelles lignes, de nouvelles colonnes.

On les relie aux premières par une clé commune, ici le code de la commune ou le nom de l'entreprise.

Croiser, c'est mettre des variables face à face : la taille de l'entreprise et le fait de recruter ou non, le secteur et le type de contrat, la commune et le salaire affiché.

Plus de données, c'est plus de questions possibles.

Ce que vous en tirez dépend des variables que vous choisissez de croiser.

À vous, maintenant
Présentation
1. Le groupe 2. Une IA qui code 3. Une première question cinq au maximum installée dans le terminal posée aux données > _ ?
Les trois temps des deux heures de travail : former un groupe de cinq au maximum, installer une IA qui code dans le terminal, poser une première question aux données du dépôt. Source : schéma de l'auteur, d'après le dépôt metier.
Former les groupes

Vous êtes 69 : 35 en TD 1, 34 en TD 2.

Cinq au maximum par groupe, soit au moins sept groupes dans chaque TD.

Le métier visé peut différer d'un membre à l'autre, selon vos parcours.

Restez dans votre groupe de TD : en sortir n'est pas interdit, mais c'est plus simple pour tout le monde.

Installer une IA qui code

Il vous faut une IA qui travaille dans un dossier de votre ordinateur, depuis le terminal, pas dans le navigateur. Claude Code est conseillé ; sinon, Gemini CLI ou GitHub Copilot, gratuits.

Créez votre compte GitHub avec votre adresse de l'université : le GitHub Student Developer Pack donne accès à Copilot.

Se faire la main

Récupérez les données du dépôt, ouvrez-les, posez une première question à l'agent.

Une étape à la fois : vérifiez que c'est fait, et juste, avant de passer à la suivante.

Pour le TD 1, le 29 septembre

Apportez vos données, et des graphiques qui décrivent ce qu'elles contiennent, chacun lu avec un chiffre.

C'est le premier passage au tirage : ce qui est montré doit tenir debout.