Blog

Retours d'expérience

Ce qui se passe quand on construit soi-même une plateforme d'inférence : les mesures, les arbitrages, les incidents et ce qu'ils coûtent vraiment.

  1. agentsarchitectureon-premisecomparatifAgents IA on-premise : trois architecturesTrois runtimes d'agents évalués sur le même matériel et le même modèle, avec des seuils écrits avant la mesure. Ce qu'ils protègent, ce qu'ils laissent passer, ce qu'ils coûtent, et pourquoi le choix ne se joue pas là où on l'attend.
  2. conformitéfacturationautomatisationextractionFacture électronique : ce qui change au 1er septembreAu 1er septembre 2026, toute entreprise assujettie à la TVA doit être capable de recevoir une facture électronique. Ce que l'obligation couvre vraiment, les formats, le rôle des plateformes agréées, et ce que l'automatisation change une fois la contrainte posée.
  3. llmqualitéobservabilitépythonEditos : trois défauts qu'un pipeline IA taitUn correcteur éditorial qui parle de lui-même dans le livrable, un GPU qui disparaît sans erreur, un total juste mais trompeur. Trois défauts silencieux d'un pipeline de correction par LLM, comment ils ont été trouvés, et la prédiction falsifiable qui a validé le correctif.
  4. ragllmrgpdvisiondjangoDeux modules IA dans une application de santéUn assistant conversationnel RAG et un essayage virtuel par génération d'images, livrés dans la même application. Les arbitrages qui ont tenu, le garde-fou d'identité qu'il a fallu recalibrer, et le faux négatif qui excluait une partie des utilisatrices.
  5. agentspocsécuritémesureHermes : ce qu'un POC de trois heures a montréNeuf critères, huit tenus, un partiel. Et surtout trois comportements qu'aucune fiche produit n'annonce : des paquets installés à chaque démarrage, trois réglages là où la documentation en donne un, et une panne visible uniquement sur le canal qu'on n'avait pas testé.
  6. agentssécuritésandboxpocIronClaw : le secret absent, pas refuséOnze tests sur un runtime d'agent en Rust : deux échecs assumés, et un mode de défaillance rare. Le secret n'est pas protégé par un refus poli, il est structurellement absent du processus. Ce que ça change, et les trois réglages sans lesquels rien de tout cela ne tient.
  7. agentsarchitectureon-premiseobservabilitéOpenClaw : ce que deux phases sur sept ont apprisUne plateforme multi-agents auto-hébergée, planifiée en sept phases, dont deux sont livrées. Ce qui tourne vraiment en continu, comment les garde-fous sont devenus vérifiables, et l'affirmation que nous avons dû retirer parce qu'elle n'était pas prouvable.
  8. llmmlopsgpusouverainetéMigrer un LLM de production en moins de 5 minutesCinq jours après sa sortie, un modèle de 27 milliards de paramètres remplaçait celui qui sert un assistant en production, sur du matériel auto-hébergé. La méthode de dé-risquage, l'arbitrage qui nous a fait renoncer à 50 % de débit, et les mesures qu'il a fallu jeter.
  9. agentssreiacsécuritéCe que l'agent a refusé de faire, à 3 h du matinUn agent IA a construit et prouvé ma haute disponibilité pendant que je dormais, puis s'est arrêté net avant la bascule. Le protocole qui rend ça possible, les trois fois où il m'a contredit, et la faute qu'il a commise cette nuit-là.
  10. proxmoxhaute disponibilitésrekeepalivedHaute disponibilité Proxmox sans clusterQuatre nœuds autonomes, du stockage local, des GPU épinglés, et pourtant des services qui survivent à la perte d'un serveur. Sans corosync, sans quorum, sans Ceph. Les mesures, les pièges d'exploitation, et ce qui n'est pas encore en place.
  11. rexgpusreobservabilitéQuatre GPU morts à 1 h du matin, et le mauvais coupableUn bug NVIDIA non corrigé nous pendait au nez. La panne est arrivée, et ce n'était pas lui. Le capteur posé quelques jours plus tôt a permis de trancher en minutes au lieu d'une nuit, et c'est la seule raison pour laquelle l'incident a duré onze minutes.
  12. rexproxmoxgpullmProxmox 9 : 35 % de débit perdu, aucune régressionAprès une montée de Proxmox 8.4 vers 9.2.3, mes serveurs d'inférence tombent de 37 à 24 tokens par seconde. Tout accusait le nouveau driver NVIDIA. Le diagnostic a dit autre chose, et la leçon vaut pour toute migration : mesurer avant d'accuser.
  13. llmagentsopen-weightsQwen-AgentWorld : simuler le monde avant d'agirUn modèle open-weights entraîné à prédire la réaction de l'environnement, pas seulement la prochaine action. Pour qui déploie des agents chez ses clients, cela ouvre une pratique qui manque cruellement au marché : répéter avant de jouer.