L’actualité de la donnée de juillet 2026

J’ai fini par développer une sorte de concept où nous présentons toutes et tous une certaine forme d’irrationalité. Sans doute que nous avons toutes et tous notre quart d’heure de folie chaque jour.

Plus sérieusement, pourquoi tout le monde prend un système d’exploitation alors même que l’on connaît ses défaillances ? Pourquoi tous se diriger vers le cloud quand on sait que le gérer présente autant sinon plus de complexité que sur site ;  que l’on est à la merci du fournisseur ? Et désormais à la merci de l’Etat où il est édité ! Et ainsi, cette souveraineté dont tout le monde a subitement pris conscience quand depuis 20 ans les défenseurs du libre et de l’open source mettent en garde…

Et là, alors la France a chaud. Toute la France est en feu. Toute l’Europe est en feu. Nous avons tous chaud. Ou à peu près tous ! Et là aussi nous pouvons tous reconnaître une belle irrationalité de nos décisions depuis, depuis au moins 40 ans !

Il est néanmoins toujours temps de tout recommencer ! En effet, un format tellement utilisé ;  il traîne des dépendances lourdes et anciennes… Il est totalement rationnel d’ouvrir les yeux, de reconnaître la dette technique et de se lancer. Merci une fois de plus à Gunnar Morling, qui s’est attaqué à Apache Parquet après avoir longtemps servi de lead Developer sur Debezium.

Et si Apple venait jouer les trublions dans l’IA ! Apple sort les Apple Foundation Models ; Apple veut se différencier de Google, Meta, Microsoft en disant : “Chez nous, votre IA reste privée !” Et il est important de fournir un environnement de développement et une plateforme qui répond aux nouvelles exigences de l’IA. Vous aurez toujours un agent prêt à l’emploi dans votre IPhone.

Data Engineering à l’ère de l’IA

La donnée est une chaîne. De sa collecte à sa consommation en passant par sa consolidation et à même à sa distribution vers les systèmes sources, chaque étape est autant importante que la précédente. Surtout, je considère que travailler dans la donnée demande beaucoup.

Aujourd’hui avec l’IA et le devoir de repenser chacun des rôles sur cette chaîne, il devient primordial de maîtriser l’activité des clients, la compréhension de leur système et la manière même dont le logiciel dont il faut tirer la donnée sont bâtis.

Oui, les Agents IA vont aider : de quelles manières ? Après avoir exploité les agents IA personnellement… Comment est-ce que l’on collabore à plusieurs avec eux ? Et attention aux contextes ! Nous répétons tous le même chemin : on adopte l’IA, on trouve que c’est génial ! Et après. Je considère qu’en matière d’IA il ne faut pas réfléchir trop longtemps : à cette heure le premier super cas d’usage : c’est coder ! L’informatique au service de l’informatique. Ce paradigme s’applique aussi au Data Engineering.

Approchez ! N’ayez pas peur ! Nous vous montrons comment il faut désormais structurer votre projet data afin de pleinement tirer partie de l’IA pour le Data Engineering.

Context, Context, Context

Dremio possède les métadonnées de l’ensemble de l’écosystème de vos tables qu’il fédère. En plus, vous avez bien travaillé : vous y avez bien exploité ces tags et ces wiki pour documenter vos tables et autre vue ! Tout le monde parle de contexte. De quoi s’agit-il ?

Vous rappelez vous de la définition d’un système décisionnel, non ? Il est question de “rendre intelligible”, “rendre lisible”. Et bien pour vos LLM c’est pareil ! Avec toutes ses métadonnées, Dremio est déjà prêt pour votre IA.

Tout le monde se pose la question quant à la meilleure manière d’articuler ce context. Google propose un format : Open Knowledge Format. On pourrait l’exploiter dans le wiki de Dremio, dans le Knowledge Catalog (anciennement Dataplex) ou tout simplement dans le fichier markdown !

Nous franchissons un pas, et employons les bonnes pratiques de l’IA afin de délivrer plus rapidement vos projets ! Dremio raccourcissait déjà les projets et ici on peut mettre un vrai coup d’accélération. Nous vous mentirions si nous ne vous mettions pas en garde : ce mouvement en avant n’est possible que si l’accès aux données est garanti. Et vous le savez comme nous, ces projets sont des projets d’organisation.

Ce type de projet est forcément un engagement, une mobilisation des équipes. Nous ne pouvons pas tout. Nous ne savons toujours pas créer la donnée alors qu’elle n’existe pas. Nous ne saurons pas pour vous vos propres règles métier. Même si l’Agent IA apporte son aide, il ne saura pas sans vos mots formaliser une intention ! Et la bonne pratique veut que l’on conserve le contexte sous une forme vérifiable et dont le produit est déterministe.

AI : Le local n’est plus un doux rêve

Alors ça je l’attends ! Je ne me suis pas mis à ChatGPT en 2022 : j’ai testé et j’ai été déçu. Mais j’avais compris que quelque chose était en train de se passer.

Synaltic vie grâce à l’Open Source. Les communautés de scientifiques de l’open source s’y sont vite mis ! Et dites vous bien que ces mêmes communautés étaient déjà très impliquées. Si bien que les premiers mots des spécialistes rappelait que ChatGPT n’avait rien de révolutionnaire; que c’était de la “bonne ingénierie”.

Néanmoins 4 ans après, une importante partie de la communauté reconnaît que l’inférence locale est possible ! Les modèles sont tellement nombreux, Les cas d’usage tout aussi large. Nous sommes sûrs que vous trouverez chaussure à votre pied.

Construire un Data Lakehouse peut être effrayant. Bien découpé, organisé en domaine, on s’en sort. Héberger son propre moteur d’inférence, c’est possible. Il faut essayer. Et vis à vis de la souveraineté, ça rend service. Même le patron de Microsoft le claironne. Osez franchir le pas.

Pour compléter votre LECTURE :

TabPFN-3: Technical Report
TabPFN-3 franchit une nouvelle étape pour les modèles de fondation sur données tabulaires : il atteint l’état de l’art sur des jeux allant jusqu’à 1 million de lignes tout en étant jusqu’à 20× plus rapide que TabPFN-2.5.

A Bitter Lesson for Data Filtering
Les auteurs montrent que, pour les très grands modèles disposant de suffisamment de puissance de calcul, il est souvent préférable de ne pas filtrer les données d’entraînement : même les données de faible qualité peuvent améliorer les performances du modèle.

LOGICIELS
Mise à jour de juillet 2026 

Apache Airflow 3.3.0

Correctifs de stabilité, améliorations des providers, optimisation du scheduler et mises à jour mineures après la série 3.2.x.