AI QA Engineer Intern at Reduck
Stage Paris (Paris)
Description de l'offre
À propos
Our company
Reduck is the fast lane for AI agents on the web.
2026 has been the year for coding, cyber and math agents, but broader knowledge work (finance, ops, growth, etc.) hasn't been as impacted, especially in enterprise setups.
Connecting your Agent to the key apps you use is a remaining challenge for large scale adoption. Today, even if Agents can do Computer Use to automate sites with no API, such as LinkedIn, Reddit or your custom ERP, Computer Use is inadequate for complex and heavy workloads as it is unreliable, slow, and expensive.
That's why we built Reduck MCP: the easiest way for an agent to integrate and automate any site you use.
Reduck MCP allows agents to discover, run and create browser automation scripts that serve as tools. Scripts run in your own Chrome, through our extension, so your agent works where you are logged in, with no credentials exposure and no bot detection.
Our ever-extending official library of scripts already includes LinkedIn, Twitter, Reddit, and more, to get started with automated lead discovery and enrichment, or customized feed.
Watch our product demo
Our team
We are a new French startup with three experienced repeat founders, Daniel (CEO), Louis (CTO) and Raphael (COO), and we've raised over EUR2.6 million.
Daniel and Raphael co-founded Mithril Security which collaborated with OpenAI to deploy privacy-by-design LLMs using hardware-based secure enclaves with our open-source project, launched LaVague , the first open-source AI Web Agent in 2024 which hit 6k stars, and sold the company to H Company , a company founded by Deepmind engineers which raised $220M.
Louis Abraham is a leading AI engineer and researcher experienced in building impactful products. He co-founded Secrecy , where he developed an end-to-end encryption platform and patented cryptographical protocols, collaborated with Stanford on breakthrough biomedical machine learning research, and was a finalist of ICPC , the most prestigious competitive programming contest in the world.
Descriptif du poste
Chez Reduck, on construit la couche d'automatisation qui permet à des agents IA d'utiliser le web comme un humain : cliquer, remplir des formulaires, naviguer des sites complexes, de façon fiable et à grande échelle. Notre catalogue compte aujourd'hui des centaines de scripts utilisés en production par nos clients, pilotés par des agents IA.
La QA chez nous ne se limite pas à « tester si un script tourne ». Le vrai sujet, c'est la fiabilité de l'IA elle-même : est-ce que l'agent a bien compris la tâche, est-ce qu'il a cliqué au bon endroit pour la bonne raison, est-ce que sa sortie est correcte, est-ce qu'une régression vient du site qui a changé ou du modèle qui déraille. On a besoin de quelqu'un qui construit les outils et les process pour répondre à ces questions en continu, pas juste qui clique sur « rejouer le test ».
Tu ne seras pas un testeur manuel. Tu vas :
· Auditer et classifier les erreurs de prod à grande échelle (des milliers de runs) : script cassé vs erreur du site externe vs mauvaise décision de l'IA vs mauvais input utilisateur
· Construire des classifieurs (souvent eux-mêmes des LLM juges) qui distinguent ces catégories automatiquement, et challenger leur fiabilité (précision, biais, dérive)
· Écrire des scénarios de test end-to-end qui tournent en boucle (monitoring continu) pour détecter les régressions avant qu'un client ne les subisse
· Creuser les cas ambigus à la main quand l'automatisation ne suffit pas, et en tirer des règles réutilisables
· Documenter les patterns de bugs récurrents pour muscler nos guidelines d'authoring de scripts
Les scripts Reduck (Playwright/TypeScript) sont un outil parmi d'autres dans ce rôle, pas le rôle en entier : la partie « soft » (analyse, classification, jugement sur des cas flous, écriture de règles) compte au moins autant que la partie code.
Profil recherché
· Tu es rigoureux et tu aimes comprendre pourquoi ça casse plutôt que de contourner le symptôme
· Tu es bon en « vibe coding » : tu sais te servir d'un assistant IA (Claude Code, Cursor, etc.) pour aller vite et produire du code correct, pas juste copier-coller ce qu'il te donne
· À l'aise avec du code (JavaScript/TypeScript et/ou Python) pour écrire des scénarios de test et des scripts d'analyse
· Tu as déjà manipulé des LLM en pratique (prompt engineering, LLM-as-judge, évaluation de modèle) — projet perso ou école, pas besoin d'expérience pro
· Une base en automatisation web (Playwright, Selenium, ou équivalent) est un plus, pas un prérequis
· Tu sais raisonner sur des données ambiguës et écrire une analyse claire, pas juste taper du code
· Français courant à l'écrit et à l'oral (échanges clients et équipe en français)
· Droit de travailler en France, présentiel à Paris
Process de recrutement
· Échange rapide (visio ou tél)
· Test technique (take-home ~72h)
· Entretien final
Informations complémentaires
· Type de contrat : Stage (2 à 6 mois)
· Lieu : Paris