L'IA générative, d'où ça vient ? 10 dates pour comprendre ChatGPT (et ce que ça change pour votre PME)
Pourquoi s'intéresser à l'histoire quand on dirige une PME ?
Pour la plupart des gens, l'IA générative commence le 30 novembre 2022, avec ChatGPT. Pour les chercheurs, ChatGPT n'était pas une surprise : c'était l'aboutissement d'une dizaine d'années de travaux, souvent publiés en accès libre.
Connaître ce chemin n'est pas qu'une curiosité. Il explique trois choses que tout dirigeant devrait savoir avant de confier un travail à une IA : pourquoi ça marche, pourquoi ça se trompe et pourquoi les prix baissent aussi vite.
La vidéo : Monsieur Phi raconte les débuts des machines qui parlent
Thibaut Giraud, philosophe et vulgarisateur connu sous le nom de Monsieur Phi, a publié le 10 octobre 2026 une vidéo d'une heure vingt sur cette histoire, « Pourquoi le langage semblait inaccessible aux machines (et comment on le leur a donné par accident) », en partant de GPT-1 et même d'avant. C'est clair, sourcé et sans jargon inutile : idéal pour un trajet en train ou une pause de midi.
Sa thèse : entre 2019 et 2020, l'être humain a perdu le monopole du langage. Pas parce que les machines « pensent », mais parce qu'elles produisent désormais un langage inédit, cohérent et adapté à une grande variété de situations, ce qui était jusque-là notre exclusivité. La thèse est discutée : pour certains philosophes, parler suppose une intention et une expérience du monde que ces modèles n'ont pas.
Les 10 dates à retenir
| Date | Étape | Ce qu'il faut retenir |
|---|---|---|
| 2011 | Un réseau de neurones écrit lettre par lettre | Environ 5 millions de paramètres, 100 Mo de Wikipédia : des phrases grammaticales par endroits, mais sans suite logique |
| 2012 | AlexNet | 60 millions de paramètres entraînés sur cartes graphiques : l'apprentissage profond s'impose en reconnaissance d'images |
| Janvier 2017 | Les « mélanges d'experts » de Google | Un modèle de 137 milliards de paramètres : la course à la taille commence |
| Juin 2017 | Le Transformer (« Attention Is All You Need ») | L'architecture sur laquelle reposent encore les modèles actuels |
| 2018 | GPT-1 (OpenAI) | Un pré-entraînement sur environ 7 000 livres, puis un ajustement par tâche |
| Octobre 2018 | BERT (Google) | Un score de 80,5 sur le banc d'essai GLUE : le pré-entraînement devient la norme |
| 14 février 2019 | GPT-2 | 1,5 milliard de paramètres, 40 Go de texte web ; OpenAI retarde la publication complète par crainte d'abus |
| 13 mars 2019 | « The Bitter Lesson » de Rich Sutton | Les méthodes générales qui exploitent la puissance de calcul finissent par l'emporter, et de loin |
| Mai 2020 | GPT-3 | 175 milliards de paramètres ; il suffit de donner quelques exemples dans la demande pour qu'il exécute une nouvelle tâche |
| 30 novembre 2022 | ChatGPT | Un GPT entraîné au dialogue grâce aux retours d'évaluateurs humains ; GPT-4 suit le 14 mars 2023 |
2011-2012 : les débuts modestes
En 2011, Ilya Sutskever (futur cofondateur d'OpenAI), James Martens et Geoffrey Hinton entraînent un réseau qui lit du texte caractère par caractère et apprend à deviner le suivant. Le résultat ressemble à de l'anglais de loin, mais n'a pas de sens. L'année suivante, AlexNet, signé par Sutskever, Hinton et Alex Krizhevsky, montre qu'un grand réseau entraîné sur des cartes graphiques écrase les méthodes classiques en reconnaissance d'images.
2017 : la taille et le Transformer
En janvier 2017, une équipe de Google (dont Noam Shazeer et Geoffrey Hinton) construit un modèle de 137 milliards de paramètres, en n'activant à chaque fois qu'une petite partie du réseau. En juin, huit chercheurs, pour la plupart chez Google, publient le Transformer, qui abandonne la lecture mot après mot au profit d'un mécanisme d'« attention » : chaque mot est mis en relation avec tous les autres, et l'entraînement se parallélise beaucoup mieux. C'est le T de GPT, qui n'en garde que la partie qui génère le texte.
2018-2019 : pré-entraîner d'abord, spécialiser ensuite
GPT-1 introduit une idée simple : entraîner d'abord le modèle à prédire la suite de textes ordinaires (des livres), puis l'ajuster à une tâche précise. BERT, chez Google, pousse la même logique et domine les bancs d'essai. Avec GPT-2, OpenAI augmente simplement la taille du modèle et des données. Le modèle se met à résumer, traduire ou répondre à des questions sans avoir été entraîné pour cela, de façon encore très inégale, mais c'est nouveau. OpenAI ne publie d'abord qu'une petite version, puis la version complète le 5 novembre 2019.
Au même moment, Rich Sutton, pionnier de l'apprentissage par renforcement, publie un court texte devenu célèbre : en 70 ans de recherche, les méthodes générales qui profitent de l'augmentation de la puissance de calcul ont fini par battre, et de loin, les approches qui codent le savoir humain à la main.
2020-2023 : du laboratoire au grand public
GPT-3, plus de cent fois plus grand que GPT-2, sait accomplir une tâche nouvelle à partir de quelques exemples donnés dans la demande. ChatGPT ajoute une étape décisive : des évaluateurs humains rédigent des exemples de bonnes réponses puis classent celles du modèle, et ces jugements servent à l'entraîner à répondre comme un interlocuteur utile. Résultat : un outil qui dialogue, accessible à tous. Le reste, vous le connaissez.
Ce que cette histoire change pour votre PME
Pourquoi ça marche : prédire la suite, à très grande échelle
Un modèle de langage ne consulte pas une base de faits : il prédit la suite la plus plausible d'un texte. À très grande échelle, cette prédiction capture la grammaire, le style, beaucoup de connaissances et une part de raisonnement. C'est pour cela qu'il excelle à rédiger, reformuler, résumer et traduire, les tâches que nous recommandons pour démarrer (voir IA en PME : par où commencer).
Pourquoi ça se trompe : il préfère deviner
Prédire la suite plausible n'est pas dire le vrai. OpenAI l'a reconnu en 2025 : l'orthographe ou la grammaire se retrouvent partout dans les textes et s'apprennent bien, mais un fait rare et isolé (une date, un numéro, une référence) ne se déduit d'aucune régularité. Et les tests utilisés pour noter les modèles récompensent une réponse au hasard plutôt qu'un « je ne sais pas ».
Conséquence pratique : vérifiez toujours les chiffres, les noms, les dates et les références produits par une IA, surtout dans un document qui part chez un client ou à l'administration.
Pourquoi les prix baissent : la leçon de Sutton, côté portefeuille
Selon l'AI Index 2025 de l'université Stanford, le prix d'un modèle qui obtient le même score que GPT-3.5 (le modèle du premier ChatGPT) à un test de connaissances générales est passé d'environ 20 dollars par million de tokens (morceaux de mots) en novembre 2022 à 0,07 dollar en octobre 2024 : une division par plus de 280 en moins de deux ans.
Pour une PME, cela veut dire :
- évitez les engagements longs sur un outil ou un tarif : réévaluez au moins une fois par an ;
- un modèle « moyen » d'aujourd'hui vaut souvent le meilleur modèle d'il y a deux ans : il n'est pas toujours utile de payer le plus cher ;
- des modèles assez performants tournent désormais sur vos propres machines, sans envoyer vos données dans le cloud (voir l'IA locale).
Testez-vous
Chez ExsIT
Nous aidons les PME et les indépendants à choisir l'outil d'IA adapté à leurs tâches, au bon prix, et à former l'équipe à vérifier ce qu'il produit. Et quand vos données ne doivent pas sortir de chez vous, nous installons des modèles locaux.
Sources
Anselin, G. (2026, 7 mai). Robots parleurs. La Vie des idées. https://laviedesidees.fr/Robots-parleurs
Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., et al. (2020). Language models are few-shot learners. arXiv. https://doi.org/10.48550/arXiv.2005.14165
Centre national du cinéma et de l'image animée. (2021, 24 septembre). Monsieur Phi, à la découverte de la philosophie. CNC. https://www.cnc.fr/creation-numerique/actualites/monsieur-phi-a-la-decouverte-de-la-philosophie_1357404
Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2018). BERT: Pre-training of deep bidirectional transformers for language understanding. arXiv. https://doi.org/10.48550/arXiv.1810.04805
Giraud, T. (2025). La parole aux machines : philosophie des grands modèles de langage. Grasset.
Heaven, W. D. (2022, 30 novembre). ChatGPT is OpenAI's latest fix for GPT-3. It's slick but still spews nonsense. MIT Technology Review. https://www.technologyreview.com/2022/11/30/1063878/openai-still-fixing-gpt3-ai-large-language-model/
Kalai, A. T., Nachum, O., Vempala, S. S., & Zhang, E. (2025). Why language models hallucinate. arXiv. https://doi.org/10.48550/arXiv.2509.04664
Krizhevsky, A., Sutskever, I., & Hinton, G. E. (2012). ImageNet classification with deep convolutional neural networks. Advances in Neural Information Processing Systems, 25. https://papers.nips.cc/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html
Maslej, N. (2025, 7 avril). AI Index 2025: State of AI in 10 charts. Stanford HAI. https://hai.stanford.edu/news/ai-index-2025-state-of-ai-in-10-charts
Monsieur Phi [Giraud, T.]. (2026, 10 octobre). Pourquoi le langage semblait inaccessible aux machines (et comment on le leur a donné par accident) [Vidéo]. YouTube. https://youtu.be/PUxgpy81Cnc
OpenAI. (2019, 14 février). Better language models and their implications. https://openai.com/index/better-language-models/
OpenAI. (2023, 14 mars). GPT-4. https://openai.com/index/gpt-4/
OpenAI. (2025, 5 septembre). Why language models hallucinate. https://openai.com/index/why-language-models-hallucinate/
Radford, A., Narasimhan, K., Salimans, T., & Sutskever, I. (2018). Improving language understanding by generative pre-training. OpenAI. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf
Shazeer, N., Mirhoseini, A., Maziarz, K., Davis, A., Le, Q., Hinton, G., & Dean, J. (2017). Outrageously large neural networks: The sparsely-gated mixture-of-experts layer. arXiv. https://doi.org/10.48550/arXiv.1701.06538
Sutskever, I., Martens, J., & Hinton, G. E. (2011). Generating text with recurrent neural networks. Proceedings of the 28th International Conference on Machine Learning (ICML 2011). https://www.cs.utoronto.ca/~ilya/pubs/2011/LANG-RNN.pdf
Sutton, R. (2019, 13 mars). The bitter lesson. Incomplete Ideas. http://www.incompleteideas.net/IncIdeas/BitterLesson.html
Synced. (2019, 5 novembre). OpenAI releases 1.5 billion parameter GPT-2 model. https://syncedreview.com/2019/11/05/openai-releases-1-5-billion-parameter-gpt-2-model/
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is all you need. arXiv. https://doi.org/10.48550/arXiv.1706.03762