Recherche alternance admin réseau

Théo CHARLET (RDTvlokip)

AI Researcher | Technicien TSSR | NLP Specialist

Spécialisé dans la recherche NLP fondamentale et l'administration système. Créateur d'AG-BPE, LISP-7 et RDTvlokip Search.

Voir mon travail Me contacter

À Propos

Je suis un chercheur passionné par le NLP et l'IA, spécialisé dans la tokenization et l'entraînement from-scratch. Développeur de RDTvlokip Search, un moteur de recherche axé sur la vie privée et la transparence. Diplômé TSSR, je combine une expertise en infrastructure système avec une recherche académique de pointe.

« Je suis dyslexique. Et c'est mon superpower. Cela me permet d'aborder les problèmes complexes avec une perspective unique et créative. »

Formation
TSSR — Nepsod, Bel Air School (juin 2025 – mai 2026)
Localisation
Lyon, France

Voir ma stack & outils

Projets & Recherches

Contributions majeures dans le domaine du NLP, de la cryptographie et de l'intelligence artificielle.

AG-BPE (Attention-Guided Byte-Pair Encoding)

Tokéniseur qui combine BPE et attention Transformer multi-couches pondérée (v4) pour des décisions de fusion sémantiquement cohérentes. Compression 3,85x, décodage 0,03ms, zéro OOV dur sur du texte multilingue (français, coréen, symboles mathématiques, emojis).

  • NLP
  • Tokenization
  • Python
  • Transformers
  • Stars : 3
  • Views : 1K
  • Downloads : 898
  • Citations : 0
  • Compression : 3,85x
  • Décodage : 0,03ms

Zenodo GitHub Hugging Face

Détails techniques

  • Attention pondérée multi-couches — Un ContextAnalyzer à 6 couches Transformer (12 têtes, dimension 768) calcule un score d'attention par paire de caractères sur chaque couche, agrégé avec des poids appris qui privilégient les couches profondes — plus sémantiquement riches. Le score de fusion final combine fréquence brute et attention pondérée (λ = 1000).
  • Robustesse multilingue parfaite — Zéro token hors-vocabulaire "dur" sur un corpus de test mêlant français, coréen (안녕하세요), symboles mathématiques et emojis — malgré un entraînement uniquement sur corpus français. Exemple : AG-BPE segmente correctement "cor|éen" là où GPT-2 casse le mot en "cor|é|en".
  • Benchmark contre GPT-2, BERT, T5 et tiktoken — Avec un vocabulaire de 18 000 tokens, AG-BPE v4 obtient le meilleur ratio efficacité/taille (0,0149 par Ko) parmi les tokeniseurs de production testés, et un décodage 20 à 30 fois plus rapide que GPT-2, BERT-base ou T5-base.
  • Pensé pour la production — Nettoyage Unicode avancé (normalisation NFKC, filtrage par catégories Unicode), checkpoints automatiques toutes les 1000 fusions avec reprise sur panne, gestion mémoire adaptative (échantillonnage à 100K contextes pour éviter les OOM) et sauvegarde double format (binaire + JSON lisible).

RDTextract

Extracteur HTML→Markdown conçu pour les corpus d'entraînement LLM. Élimine tout bruit (navigation, publicités, widgets répétés) avec un système de scoring qualité intégré et un fallback JSON-LD pour les pages SPA. Score de 99,3/100 sur le benchmark Tranco top-1 000 .fr — zéro artefact sur les 4 métriques mesurées. Détection multi-langue (FR/EN/ES/DE/IT). Une seule dépendance : beautifulsoup4.

  • Python
  • NLP
  • LLM
  • PyPI
  • HTML→Markdown
  • Open Source

pip install RDTextract

  • Score qualité : 99,3/100
  • Artefacts : 0
  • Pages testées : 672
  • Langues : 5
  • Licence : MIT

Benchmark comparatif

Comparaison des extracteurs HTML→Markdown sur 672 pages Tranco top-1 000 .fr
ExtracteurScore2×bulletOrphelinsHTTP dumpPara dup
RDTextract 🏆99,30000
html2text96,21148702 373
trafilatura96,11878010309
markdownify85,502461075 042

Benchmark sur 672 pages Tranco top-1 000 .fr

GitHub PyPI Benchmark

LISP-7 (Linguistic Irreversible Scrambling Protocol)

Nouveau paradigme de sécurité — Destructive Semantic Encoding (DSE) — distinct de la cryptographie, du hachage et de la compression classiques. 7 niveaux hiérarchiques de brouillage sémantique culminant en une mutation d'alphabet aléatoire unique par compression (26! permutations). Résistance >10^35 ans au brute-force, testé sur 40 000+ phrases françaises.

  • Cryptography
  • Compression
  • Security
  • Algorithm
  • Resistance : >10^35 yrs
  • Compression : 60-75%
  • Espace d'états : ~10^60
  • Corpus : 40K+ phrases

Paper (PDF) GitHub

Comment ça marche

  • Un paradigme intentionnellement irréversible — Contrairement à AES ou RSA — réversibles avec la bonne clé mathématique — LISP-7 détruit intentionnellement l'information. La reconstruction exige une compréhension sémantique et un dictionnaire interne, pas une formule à casser : c'est une sécurité linguistique, pas mathématique.
  • 7 niveaux de chaos progressif — Du simple retrait des voyelles (niveau 1) à la mutation complète de l'alphabet (niveau 7), en passant par l'extraction triadique (1ère + milieu + dernière lettre), la permutation de lettres et le brouillage de l'ordre des mots. Chaque niveau ajoute une couche de désordre linguistique contrôlé.
  • Le verrou à deux clés du niveau 7 — Chaque compression génère une permutation aléatoire unique des 26 lettres (26! combinaisons possibles), stockée dans le dictionnaire. Le même texte compressé deux fois produit deux résultats totalement différents : sans la bonne combinaison texte chiffré + clé d'alphabet, aucune reconstruction n'est possible, même avec le dictionnaire.
  • Validé sur 40 000+ phrases, résistant à GPT-5 — Testé sur un corpus français du XIXe siècle (40 607 phrases, 29 339 mots uniques) : 100% de reconstruction exacte avec le dictionnaire, contre 0 à 2% de succès pour GPT-5 sans lui. Espace d'états d'environ 10^60 sur un cas réel de 22 mots — plus de 10^35 années de calcul à l'échelle exascale pour l'épuiser.

RDTSearch CLI

Client terminal officiel pour RDTvlokip Search, mon moteur de recherche indépendant français axé sur la vie privée (~4,6M pages indexées, crawler maison). Recherche directe en <200ms, autocomplete intelligent, détection de trackers et de contenu adulte, stats live du moteur, analyse SEO/backlinks complète (graphe de liens, duel entre domaines, export CSV/JSON) et une interface TUI interactive complète. Outil Python 3.8+ mono-fichier, zéro dépendance (stdlib uniquement), bilingue FR/EN, Windows en priorité (Linux/macOS supportés), sous licence AGPLv3.

  • CLI
  • Python
  • Open Source
  • Search Engine
  • Developer Tool

pip install rdtsearch

  • Latence recherche : < 200ms
  • Dépendances : 0
  • Licence : AGPLv3
  • Plateformes : Win/Linux/macOS

Site GitHub PyPI

Fonctionnalités

  • Un TUI interactif, pas juste un CLI — Lance rdtsearch sans argument pour ouvrir l'interface interactive : sidebar de stats live, palette de commandes, complétion fantôme façon fish (la suite probable apparaît en gris, acceptée avec →), historique au clavier, et un chiffre pour ouvrir un résultat dans le navigateur.
  • Détection tracker et contenu adulte intégrée — Indicateurs visuels du niveau de tracking (●/●/●) et badge 18+ affichés directement dans les résultats, avant même de cliquer.
  • De l'outillage SEO en ligne de commande — Graphe global de liens, top domaines, backlinks par domaine (source, ancre, nofollow/sponsored/UGC), distribution des ancres, historique d'évolution et export CSV/JSON — avec un cache local par jour pour économiser le quota anonyme (10 backlinks par analyse, 3 analyses par jour).
  • Zéro dépendance, un seul fichier — Écrit en Python 3.8+ stdlib uniquement, mono-fichier, Windows en priorité (Linux/macOS supportés), avec repli automatique en ASCII sur les vieilles consoles Windows. Licence AGPLv3, aucune donnée collectée — uniquement des appels à l'API RDTvlokip Search.

Cadence, Nomade & Focal — LLM français 15M

Famille de trois LLM français de 15M de paramètres entraînés from scratch (aucun poids pré-entraîné, aucune dépendance à 🤗 Transformers) sur un unique GTX 1080 Ti, pour étudier les transformers en boucle (recurrent-depth) et le calcul adaptatif par token. Cadence applique 4 fois les 8 blocs Transformer (profondeur effective 32) sans sortie anticipée ; Focal et Nomade y ajoutent une sortie anticipée par token, respectivement à seuil d'entropie absolu et à seuil percentile invariant à la taille du modèle. Résultat : -7% de perplexité de validation pour Cadence (28,9 vs 31,2 baseline), mais aucun des trois modèles ne domine sur tous les critères.

  • NLP
  • LLM
  • From-Scratch
  • Adaptive Computation
  • Research
  • Paramètres : 15M ×3
  • Perplexité (Cadence) : 28,9 (-7%)
  • Corpus : 425M tokens
  • GPU d'entraînement : 1× GTX 1080 Ti

Cadence Nomade Focal

Le détail de la recherche

  • Trois façons de boucler un même transformer — Les 8 blocs Transformer (style LLaMA : RoPE, RMSNorm, SwiGLU, QK-Norm) sont appliqués 4 fois — profondeur effective 32 — avec zéro paramètre ajouté au-delà d'un petit embedding de profondeur par itération. Cadence boucle sans sortie anticipée ; Focal arrête un token dès que son entropie de sortie passe sous un seuil fixe (1,0 nat) ; Nomade utilise un seuil percentile (30% des tokens les plus confiants gèlent à chaque itération) — la seule variante dont le critère se transfère à une autre taille de modèle.
  • Aucun modèle ne gagne partout — Cadence réduit la perplexité de validation de 7% (28,9 vs 31,2 baseline) et est plus cohérente dans le domaine d'entraînement. Focal pousse encore plus loin la cohérence in-domain (44,1) mais s'effondre hors domaine (29,1). Nomade sacrifie la perplexité (31,0, quasi identique à la baseline) pour devenir le seul modèle bouclé qui bat la baseline hors domaine (41,8) et qui invente le moins de noms (0,094). Le compromis in-domain / out-of-domain est le vrai résultat de l'étude, pas un gagnant unique.
  • Protocole de recherche rapide, pas un run de production — Entraînement from scratch (aucun poids 🤗 Transformers) sur un unique GTX 1080 Ti, avec seulement 20% du corpus d'entraînement (425M tokens au total) sur 2 époques, évalué sur une seule seed (50 prompts × 200 tokens). Les tendances sont cohérentes mais les magnitudes ne sont pas validées statistiquement — traité comme un carnet de laboratoire, pas un benchmark définitif.
  • Construit sur des épaules connues, sans revendiquer de nouveauté — La famille s'inscrit explicitement dans la lignée d'ACT (Graves, 2016), Universal Transformer (Dehghani et al., 2018), Recurrent-Depth Transformer / Huginn-3.5B (Geiping et al., 2025), CALM (Schuster et al., 2022) et LoopViT (Shu et al., 2026) — avec pour base directe deux études de boucles from-scratch reproduites en français (Kohli et al. 2026, COLM ; Chen 2026). Chaque model card le dit explicitement : « no claim of novelty ».

InfiniGPT

Collaboration avec LMC. Développement d'un tokenizer GPT-2 optimisé pour le traitement du langage naturel à grande échelle.

  • LLM
  • GPT-2
  • Collaboration
  • NLP

GitHub Hugging Face

WhisperWatch

Moniteur de disponibilité dédié aux bots Discord et à vos sites/APIs. Détection instantanée des pannes via l'intent Presence, surveillance HTTPS avec vérification de sécurité des URLs (anti-phishing, certificat TLS, âge du domaine), embeds d'alertes personnalisables, détection d'instabilité et dashboard web complet.

  • Discord
  • Bot
  • Monitoring
  • SaaS
  • Dashboard
  • Commandes slash : 21
  • URLs surveillées (Free) : 10
  • Plan Premium : 0€
  • Bots max (Free) : 5

Site

Publications

  1. AG-BPE v4: Enhanced Attention-Guided Byte-Pair Encoding with Weighted Layer Aggregation

    Zenodo / Open Science · 2025 · 898 Downloads · 1K Views

  2. The Pre-Training Pitfall: Why Contextual Guidance for BPE Must Be Trained Concurrently

    Zenodo · 2025 · Preprint

  3. LISP-7: Linguistic Irreversible Scrambling Protocol — Destructive Semantic Encoding (DSE)

    Preprint · 2025 · Preprint

  4. J'ai entraîné mon propre LLM français from scratch

    Hugging Face Blog · 2026 · Série Cadence/Nomade/Focal — Article 1/4

  5. Ce que j'ai appris en optimisant un LLM français

    Hugging Face Blog · 2026 · Série Cadence/Nomade/Focal — Article 2/4

  6. Apprendre à un LLM français de 15M à penser plus profondément

    Hugging Face Blog · 2026 · Série Cadence/Nomade/Focal — Article 3/4

  7. Le mur matériel derrière ma validation multi-seed

    Hugging Face Blog · 2026 · Série Cadence/Nomade/Focal — Article 4/4

Expertise Technique

IA & NLP Research

  • Tokenization Custom — Expert
  • Transformers Architecture — Avancé
  • Training From-Scratch — Intermédiaire
  • Pytorch/TensorFlow — Intermédiaire
  • Data Efficiency — Avancé

Systèmes & Réseaux (TSSR)

  • Linux/Unix Administration — Avancé
  • DNS & DHCP — Intermédiaire
  • VPS Management — Avancé
  • Infrastructure Security — Intermédiaire
  • Bash Scripting — Avancé

Développement & Outils

  • Python — Expert
  • JavaScript/TypeScript — Intermédiaire
  • Git & CI/CD — Avancé
  • LaTeX — Intermédiaire
  • Docker — Notions

Ma Stack

Technologies et outils que j'utilise au quotidien.

Langages

  • Python
  • TypeScript
  • JavaScript
  • LaTeX
  • Bash

IA & Recherche

  • PyTorch
  • TensorFlow
  • Transformers (HF)
  • NumPy
  • BeautifulSoup4

Infrastructure

  • Linux / Debian
  • Docker
  • Nginx
  • Git & CI/CD
  • VPS (OVH)

Développement

  • React
  • Vite
  • Tailwind CSS
  • VS Code
  • Jupyter

La Roulette des Outils

Faites tourner le barillet pour sélectionner un outil.

  • VTT Editor Pro

    Éditeur de sous-titres WebVTT avancé. Visualisation temporelle, correction automatique et export compatible multi-plateformes.

    Ouvrir l'outil

  • AG-BPE

    Tester AG-BPE directement.

    Ouvrir l'outil

  • RDTvlokip Search

    Le seul moteur de recherche qui vous montre pourquoi chaque résultat apparaît, qui vous laisse contrôler le classement, et qui prouve qu'il ne vous espionne pas.

    Ouvrir l'outil

  • RDTextract

    Extracteur HTML→Markdown pour corpus LLM. Zéro artefact, scoring qualité intégré, une seule dépendance. Score 99,3/100 sur Tranco top-1 000 .fr.

    Ouvrir l'outil

  • WhisperWatch

    Surveillez vos bots Discord et vos sites web 24h/24. Alertes instantanées, vérification de sécurité des URLs, embeds personnalisables et dashboard complet. Premium gratuit pour les early adopters.

    Ouvrir l'outil

Activité GitHub

Historique de contributions et statistiques GitHub en temps réel (dépôts publics, étoiles, followers).

En ce moment

Ce sur quoi je travaille, ce que je cherche, ce que j'ai récemment terminé.

Ce que je construis

RDTvlokip Search — Moteur de recherche — vie privée & transparence. Statut : En développement actif.

  • Crawler from-scratch, zéro dépendance Bing
  • 24 signaux de ranking — BM25 adaptatif + PageRank
  • 4,6M+ pages indexées seul, sur VPS Hetzner + GTX 1080 Ti

Voir le projet

Ce que je cherche

Alternance en administration système & réseaux (Lyon / Remote)

Récemment

  • Diplômé TSSR — Nepsod, Bel Air School
  • Publication LISP-7 sur Zenodo
  • AG-BPE — 898 téléchargements

// Dernière mise à jour : Juillet 2026

Commit History

git log --graph --pretty=format:'%h - %s (%cr)' --abbrev-commit

  1. May 2026 · e6f7a8b · merge

    Merge branch 'TSSR' — Diplôme obtenu

    Réussite de l'examen Technicien Supérieur Systèmes et Réseaux. Centre de formation Nepsod, site Bel Air School.

    #TSSR #Diplôme #Education

  2. Apr 2026 · b3c4d5e · pull-request

    PR: Open to Work (Alternance - Admin Réseau)

    Recherche active d'une alternance en administration système & réseaux. Prêt à déployer mes compétences en production.

    #OpenToWork #TSSR #Alternance

  3. Nov 2025 · f4e5d6c · feat

    feat(research): LISP-7 Cryptography Paper

    Finalisation et publication du papier sur le paradigme de cryptographie sémantique destructive.

    #Crypto #Research #LaTeX

  4. Sep 2025 · a1b2c3d · feat

    feat(project): RDTvlokip Search — init

    Lancement du développement de RDTvlokip Search, un moteur de recherche axé sur la vie privée et la transparence.

    #Search #AI #Project

  5. Jun 2025 · 9h8g7f6 · merge

    Merge branch 'AG-BPE' into main

    Release officielle de l'Attention-Guided BPE. +600 téléchargements sur Zenodo.

    #NLP #Release #Zenodo

  6. Jun 2025 · 1z2y3x4 · init

    init commit: TSSR Training Start

    Début du cursus Technicien Supérieur Systèmes et Réseaux. Centre de formation Nepsod, site Bel Air School.

    #Education #TSSR

  7. Mar 2025 · 5j4k3l2 · wip

    wip: InfiniGPT Optimization

    Collaboration avec LMC pour optimiser le tokenizer GPT-2.

    #Collaboration #GPT-2

(END)