Recherche alternance admin réseau
Théo CHARLET (RDTvlokip)
AI Researcher | Technicien TSSR | NLP Specialist
Spécialisé dans la recherche NLP fondamentale et l'administration système. Créateur d'AG-BPE, LISP-7 et RDTvlokip Search.
Voir mon travail
Me contacter
À Propos
Je suis un chercheur passionné par le NLP et l'IA, spécialisé dans la tokenization et l'entraînement from-scratch. Développeur de RDTvlokip Search, un moteur de recherche axé sur la vie privée et la transparence. Diplômé TSSR, je combine une expertise en infrastructure système avec une recherche académique de pointe.
« Je suis dyslexique. Et c'est mon superpower. Cela me permet d'aborder les problèmes complexes avec une perspective unique et créative. »
- Formation
- TSSR — Nepsod, Bel Air School (juin 2025 – mai 2026)
- Localisation
- Lyon, France
Voir ma stack & outils
Projets & Recherches
Contributions majeures dans le domaine du NLP, de la cryptographie et de l'intelligence artificielle.
AG-BPE (Attention-Guided Byte-Pair Encoding)
Tokéniseur qui combine BPE et attention Transformer multi-couches pondérée (v4) pour des décisions de fusion sémantiquement cohérentes. Compression 3,85x, décodage 0,03ms, zéro OOV dur sur du texte multilingue (français, coréen, symboles mathématiques, emojis).
- NLP
- Tokenization
- Python
- Transformers
- Stars : 3
- Views : 1K
- Downloads : 898
- Citations : 0
- Compression : 3,85x
- Décodage : 0,03ms
Zenodo
GitHub
Hugging Face
Détails techniques
-
Attention pondérée multi-couches —
Un ContextAnalyzer à 6 couches Transformer (12 têtes, dimension 768) calcule un score d'attention par paire de caractères sur chaque couche, agrégé avec des poids appris qui privilégient les couches profondes — plus sémantiquement riches. Le score de fusion final combine fréquence brute et attention pondérée (λ = 1000).
-
Robustesse multilingue parfaite —
Zéro token hors-vocabulaire "dur" sur un corpus de test mêlant français, coréen (안녕하세요), symboles mathématiques et emojis — malgré un entraînement uniquement sur corpus français. Exemple : AG-BPE segmente correctement "cor|éen" là où GPT-2 casse le mot en "cor|é|en".
-
Benchmark contre GPT-2, BERT, T5 et tiktoken —
Avec un vocabulaire de 18 000 tokens, AG-BPE v4 obtient le meilleur ratio efficacité/taille (0,0149 par Ko) parmi les tokeniseurs de production testés, et un décodage 20 à 30 fois plus rapide que GPT-2, BERT-base ou T5-base.
-
Pensé pour la production —
Nettoyage Unicode avancé (normalisation NFKC, filtrage par catégories Unicode), checkpoints automatiques toutes les 1000 fusions avec reprise sur panne, gestion mémoire adaptative (échantillonnage à 100K contextes pour éviter les OOM) et sauvegarde double format (binaire + JSON lisible).
LISP-7 (Linguistic Irreversible Scrambling Protocol)
Nouveau paradigme de sécurité — Destructive Semantic Encoding (DSE) — distinct de la cryptographie, du hachage et de la compression classiques. 7 niveaux hiérarchiques de brouillage sémantique culminant en une mutation d'alphabet aléatoire unique par compression (26! permutations). Résistance >10^35 ans au brute-force, testé sur 40 000+ phrases françaises.
- Cryptography
- Compression
- Security
- Algorithm
- Resistance : >10^35 yrs
- Compression : 60-75%
- Espace d'états : ~10^60
- Corpus : 40K+ phrases
Paper (PDF)
GitHub
Comment ça marche
-
Un paradigme intentionnellement irréversible —
Contrairement à AES ou RSA — réversibles avec la bonne clé mathématique — LISP-7 détruit intentionnellement l'information. La reconstruction exige une compréhension sémantique et un dictionnaire interne, pas une formule à casser : c'est une sécurité linguistique, pas mathématique.
-
7 niveaux de chaos progressif —
Du simple retrait des voyelles (niveau 1) à la mutation complète de l'alphabet (niveau 7), en passant par l'extraction triadique (1ère + milieu + dernière lettre), la permutation de lettres et le brouillage de l'ordre des mots. Chaque niveau ajoute une couche de désordre linguistique contrôlé.
-
Le verrou à deux clés du niveau 7 —
Chaque compression génère une permutation aléatoire unique des 26 lettres (26! combinaisons possibles), stockée dans le dictionnaire. Le même texte compressé deux fois produit deux résultats totalement différents : sans la bonne combinaison texte chiffré + clé d'alphabet, aucune reconstruction n'est possible, même avec le dictionnaire.
-
Validé sur 40 000+ phrases, résistant à GPT-5 —
Testé sur un corpus français du XIXe siècle (40 607 phrases, 29 339 mots uniques) : 100% de reconstruction exacte avec le dictionnaire, contre 0 à 2% de succès pour GPT-5 sans lui. Espace d'états d'environ 10^60 sur un cas réel de 22 mots — plus de 10^35 années de calcul à l'échelle exascale pour l'épuiser.
RDTvlokip Search
Moteur de recherche indépendant axé sur la vie privée et la transparence. Crawler from-scratch (RDTvlokipBot), algorithme BM25 adaptatif + PageRank (24 signaux de scoring), 4,6M+ pages indexées, hébergé en Allemagne — zéro tracker publicitaire.
- Search Engine
- Privacy
- Transparency
- Web
- From-Scratch
- Pages indexées : 4,6M+
- Signaux ranking : 24
- Domaines uniques : 295K+
- Hébergement : Allemagne 🇪🇺
Accéder
Pourquoi j'ai construit ça
-
Le vide laissé par Qwant —
Qwant utilise Bing en arrière-plan. Ce n'est pas un moteur indépendant — c'est une interface Microsoft avec un drapeau tricolore.
-
Philosophie from-scratch —
Un vrai crawler, un vrai index, un vrai algorithme. Dépendre de Bing pour un moteur "indépendant", c'est une contradiction.
-
RDTvlokipBot, un crawler qui respecte le web —
Respect intégral de robots.txt (RFC 9309) et de l'extension Content-Signal: search=no. Délai adaptatif par domaine, circuit breaker après 5 échecs consécutifs, retry exponentiel, filtre qualité (≥50 mots, dédoublonnage, respect du canonical). User-Agent transparent et vérifiable par reverse DNS — jamais d'usurpation de navigateur.
-
24 signaux, un vrai algorithme de ranking —
BM25 adaptatif dont les poids changent selon l'intention de la requête (navigationnelle, informationnelle, mixte), PageRank calculé par matrices creuses (scipy), synonymes français (~200 groupes) et stemming vectorisé NumPy — plus un modèle BERT-like maison (~20M paramètres, PyTorch) entraîné pour désambiguïser les requêtes ambiguës, comme "python" (langage ou animal).
-
Souveraineté numérique concrète —
70-80% du cloud européen contrôlé par AWS/Azure/Google. La dépendance numérique est une vulnérabilité réelle — RDTvlokip Search est ma réponse concrète.
-
Bien plus qu'un moteur de recherche —
Filtres temporel, géographique et anti-tracking (82 signatures détectées), opérateurs de recherche avancés (site:, intitle:, inurl:, filetype:), page d'inspection d'URL, graphe interactif des domaines, agrégateur RSS de 66 sources francophones, messagerie chiffrée @rdtvlokip.fr, éditeur de texte chiffré, page de preuve de non-suivi : la transparence et la vie privée sont au cœur de chaque fonctionnalité.
-
Le défi —
4,6M+ pages indexées seul, à 20 ans, sur VPS Hetzner + GTX 1080 Ti. Prouver que c'est faisable sans équipe de 50 ni millions d'euros.
RDTSearch CLI
Client terminal officiel pour RDTvlokip Search, mon moteur de recherche indépendant français axé sur la vie privée (~4,6M pages indexées, crawler maison). Recherche directe en <200ms, autocomplete intelligent, détection de trackers et de contenu adulte, stats live du moteur, analyse SEO/backlinks complète (graphe de liens, duel entre domaines, export CSV/JSON) et une interface TUI interactive complète. Outil Python 3.8+ mono-fichier, zéro dépendance (stdlib uniquement), bilingue FR/EN, Windows en priorité (Linux/macOS supportés), sous licence AGPLv3.
- CLI
- Python
- Open Source
- Search Engine
- Developer Tool
pip install rdtsearch
- Latence recherche : < 200ms
- Dépendances : 0
- Licence : AGPLv3
- Plateformes : Win/Linux/macOS
Site
GitHub
PyPI
Fonctionnalités
-
Un TUI interactif, pas juste un CLI —
Lance rdtsearch sans argument pour ouvrir l'interface interactive : sidebar de stats live, palette de commandes, complétion fantôme façon fish (la suite probable apparaît en gris, acceptée avec →), historique au clavier, et un chiffre pour ouvrir un résultat dans le navigateur.
-
Détection tracker et contenu adulte intégrée —
Indicateurs visuels du niveau de tracking (●/●/●) et badge 18+ affichés directement dans les résultats, avant même de cliquer.
-
De l'outillage SEO en ligne de commande —
Graphe global de liens, top domaines, backlinks par domaine (source, ancre, nofollow/sponsored/UGC), distribution des ancres, historique d'évolution et export CSV/JSON — avec un cache local par jour pour économiser le quota anonyme (10 backlinks par analyse, 3 analyses par jour).
-
Zéro dépendance, un seul fichier —
Écrit en Python 3.8+ stdlib uniquement, mono-fichier, Windows en priorité (Linux/macOS supportés), avec repli automatique en ASCII sur les vieilles consoles Windows. Licence AGPLv3, aucune donnée collectée — uniquement des appels à l'API RDTvlokip Search.
Cadence, Nomade & Focal — LLM français 15M
Famille de trois LLM français de 15M de paramètres entraînés from scratch (aucun poids pré-entraîné, aucune dépendance à 🤗 Transformers) sur un unique GTX 1080 Ti, pour étudier les transformers en boucle (recurrent-depth) et le calcul adaptatif par token. Cadence applique 4 fois les 8 blocs Transformer (profondeur effective 32) sans sortie anticipée ; Focal et Nomade y ajoutent une sortie anticipée par token, respectivement à seuil d'entropie absolu et à seuil percentile invariant à la taille du modèle. Résultat : -7% de perplexité de validation pour Cadence (28,9 vs 31,2 baseline), mais aucun des trois modèles ne domine sur tous les critères.
- NLP
- LLM
- From-Scratch
- Adaptive Computation
- Research
- Paramètres : 15M ×3
- Perplexité (Cadence) : 28,9 (-7%)
- Corpus : 425M tokens
- GPU d'entraînement : 1× GTX 1080 Ti
Cadence
Nomade
Focal
Le détail de la recherche
-
Trois façons de boucler un même transformer —
Les 8 blocs Transformer (style LLaMA : RoPE, RMSNorm, SwiGLU, QK-Norm) sont appliqués 4 fois — profondeur effective 32 — avec zéro paramètre ajouté au-delà d'un petit embedding de profondeur par itération. Cadence boucle sans sortie anticipée ; Focal arrête un token dès que son entropie de sortie passe sous un seuil fixe (1,0 nat) ; Nomade utilise un seuil percentile (30% des tokens les plus confiants gèlent à chaque itération) — la seule variante dont le critère se transfère à une autre taille de modèle.
-
Aucun modèle ne gagne partout —
Cadence réduit la perplexité de validation de 7% (28,9 vs 31,2 baseline) et est plus cohérente dans le domaine d'entraînement. Focal pousse encore plus loin la cohérence in-domain (44,1) mais s'effondre hors domaine (29,1). Nomade sacrifie la perplexité (31,0, quasi identique à la baseline) pour devenir le seul modèle bouclé qui bat la baseline hors domaine (41,8) et qui invente le moins de noms (0,094). Le compromis in-domain / out-of-domain est le vrai résultat de l'étude, pas un gagnant unique.
-
Protocole de recherche rapide, pas un run de production —
Entraînement from scratch (aucun poids 🤗 Transformers) sur un unique GTX 1080 Ti, avec seulement 20% du corpus d'entraînement (425M tokens au total) sur 2 époques, évalué sur une seule seed (50 prompts × 200 tokens). Les tendances sont cohérentes mais les magnitudes ne sont pas validées statistiquement — traité comme un carnet de laboratoire, pas un benchmark définitif.
-
Construit sur des épaules connues, sans revendiquer de nouveauté —
La famille s'inscrit explicitement dans la lignée d'ACT (Graves, 2016), Universal Transformer (Dehghani et al., 2018), Recurrent-Depth Transformer / Huginn-3.5B (Geiping et al., 2025), CALM (Schuster et al., 2022) et LoopViT (Shu et al., 2026) — avec pour base directe deux études de boucles from-scratch reproduites en français (Kohli et al. 2026, COLM ; Chen 2026). Chaque model card le dit explicitement : « no claim of novelty ».
InfiniGPT
Collaboration avec LMC. Développement d'un tokenizer GPT-2 optimisé pour le traitement du langage naturel à grande échelle.
GitHub
Hugging Face
WhisperWatch
Moniteur de disponibilité dédié aux bots Discord et à vos sites/APIs. Détection instantanée des pannes via l'intent Presence, surveillance HTTPS avec vérification de sécurité des URLs (anti-phishing, certificat TLS, âge du domaine), embeds d'alertes personnalisables, détection d'instabilité et dashboard web complet.
- Discord
- Bot
- Monitoring
- SaaS
- Dashboard
- Commandes slash : 21
- URLs surveillées (Free) : 10
- Plan Premium : 0€
- Bots max (Free) : 5
Site
Publications
-
Zenodo / Open Science · 2025 · 898 Downloads · 1K Views
-
Zenodo · 2025 · Preprint
-
Preprint · 2025 · Preprint
-
Hugging Face Blog · 2026 · Série Cadence/Nomade/Focal — Article 1/4
-
Hugging Face Blog · 2026 · Série Cadence/Nomade/Focal — Article 2/4
-
Hugging Face Blog · 2026 · Série Cadence/Nomade/Focal — Article 3/4
-
Hugging Face Blog · 2026 · Série Cadence/Nomade/Focal — Article 4/4
Expertise Technique
IA & NLP Research
- Tokenization Custom — Expert
- Transformers Architecture — Avancé
- Training From-Scratch — Intermédiaire
- Pytorch/TensorFlow — Intermédiaire
- Data Efficiency — Avancé
Systèmes & Réseaux (TSSR)
- Linux/Unix Administration — Avancé
- DNS & DHCP — Intermédiaire
- VPS Management — Avancé
- Infrastructure Security — Intermédiaire
- Bash Scripting — Avancé
Développement & Outils
- Python — Expert
- JavaScript/TypeScript — Intermédiaire
- Git & CI/CD — Avancé
- LaTeX — Intermédiaire
- Docker — Notions
Ma Stack
Technologies et outils que j'utilise au quotidien.
Langages
- Python
- TypeScript
- JavaScript
- LaTeX
- Bash
IA & Recherche
- PyTorch
- TensorFlow
- Transformers (HF)
- NumPy
- BeautifulSoup4
Infrastructure
- Linux / Debian
- Docker
- Nginx
- Git & CI/CD
- VPS (OVH)
Développement
- React
- Vite
- Tailwind CSS
- VS Code
- Jupyter
Activité GitHub
Historique de contributions et statistiques GitHub en temps réel (dépôts publics, étoiles, followers).
En ce moment
Ce sur quoi je travaille, ce que je cherche, ce que j'ai récemment terminé.
Ce que je construis
RDTvlokip Search — Moteur de recherche — vie privée & transparence. Statut : En développement actif.
- Crawler from-scratch, zéro dépendance Bing
- 24 signaux de ranking — BM25 adaptatif + PageRank
- 4,6M+ pages indexées seul, sur VPS Hetzner + GTX 1080 Ti
Voir le projet
Ce que je cherche
Alternance en administration système & réseaux (Lyon / Remote)
Récemment
- Diplômé TSSR — Nepsod, Bel Air School
- Publication LISP-7 sur Zenodo
- AG-BPE — 898 téléchargements
// Dernière mise à jour : Juillet 2026
Commit History
git log --graph --pretty=format:'%h - %s (%cr)' --abbrev-commit
-
May 2026 · e6f7a8b · merge
Merge branch 'TSSR' — Diplôme obtenu
Réussite de l'examen Technicien Supérieur Systèmes et Réseaux. Centre de formation Nepsod, site Bel Air School.
#TSSR #Diplôme #Education
-
Apr 2026 · b3c4d5e · pull-request
PR: Open to Work (Alternance - Admin Réseau)
Recherche active d'une alternance en administration système & réseaux. Prêt à déployer mes compétences en production.
#OpenToWork #TSSR #Alternance
-
Nov 2025 · f4e5d6c · feat
feat(research): LISP-7 Cryptography Paper
Finalisation et publication du papier sur le paradigme de cryptographie sémantique destructive.
#Crypto #Research #LaTeX
-
Sep 2025 · a1b2c3d · feat
feat(project): RDTvlokip Search — init
Lancement du développement de RDTvlokip Search, un moteur de recherche axé sur la vie privée et la transparence.
#Search #AI #Project
-
Jun 2025 · 9h8g7f6 · merge
Merge branch 'AG-BPE' into main
Release officielle de l'Attention-Guided BPE. +600 téléchargements sur Zenodo.
#NLP #Release #Zenodo
-
Jun 2025 · 1z2y3x4 · init
init commit: TSSR Training Start
Début du cursus Technicien Supérieur Systèmes et Réseaux. Centre de formation Nepsod, site Bel Air School.
#Education #TSSR
-
Mar 2025 · 5j4k3l2 · wip
wip: InfiniGPT Optimization
Collaboration avec LMC pour optimiser le tokenizer GPT-2.
#Collaboration #GPT-2
(END)