Launch Legends
Wynd Labs
Ingénieur Recherche Crawling
Qui sommes-nous
Nous construisons l'infrastructure qui fournit des quantités massives de données web aux entreprises qui entraînent les modèles d'IA les plus puissants au monde.
Nous sommes l'équipe qui alimente et soutient Grass, un réseau de partage de bande passante qui nous permet d'opérer un crawler distribué massif, nous donnant un accès unique à des données web publiques de haute qualité à l'échelle mondiale. En plus de cela, nous avons construit des pipelines pour ingérer, segmenter et annoter des milliards de vidéos, de transcriptions et de fichiers audio, alimentant la création de jeux de données pour les laboratoires de pointe.
Nous sommes une équipe agile, technique et rapide. Pas de bureaucratie, pas de prise de décision lente ; juste une équipe de bâtisseurs qui repoussent les limites de ce qui est possible pour les données du web ouvert et l'IA.
Aperçu
En tant qu'Ingénieur Recherche Crawling, vous concevrez et opérerez des systèmes d'acquisition de données web à grande échelle pour la recherche et le développement de modèles. Votre travail couvrira les systèmes distribués, l'infrastructure de scraping et les pipelines de données.
Pourquoi travailler avec nous
Opportunité. Nous sommes à l'avant-garde du développement d'un crawler et d'un graphe de connaissances à l'échelle du web qui améliore l'accès aux données publiques du web et étend la valeur de l'IA aux personnes.
Culture. Nous sommes une équipe agile avec des standards élevés. Nous venons travailler non pas pour être à l'aise, mais pour découvrir ce dont nous sommes capables et pour faire un travail qui compte. Nous n'appelons pas ceux qui maintiennent le statu quo. Nous appelons ceux qui rendent meilleurs tous ceux qui les entourent.
Nous privilégions le faible ego et le rendement élevé. C'est une équipe entièrement à distance.
Exigences
Veuillez noter : Ce rôle nécessite un horaire de travail qui chevauche suffisamment les heures de bureau EST pour collaborer efficacement avec l'équipe.
- Solide expérience en programmation dans un ou plusieurs des langages suivants : Go, Rust, Python, Java, ou C++
- Expérience dans la construction de web crawlers ou de pipelines de données à grande échelle
- Compréhension solide de HTTP, des réseaux et du comportement des navigateurs
- Familiarité avec les systèmes distribués et le traitement parallèle
- Expérience de travail avec de grands jeux de données (échelle TB–PB préférée)
- Capacité à déboguer des environnements instables ou hostiles
Responsabilités
- Construire et maintenir des crawlers web à grande échelle sur divers domaines
- Concevoir des systèmes à haut débit et tolérants aux pannes pour la collecte de données (millions à milliards d'URL/jour)
- Gérer les systèmes anti-bots, les limites de débit, et les sites dynamiques/riches en JavaScript
- Développer des pipelines pour le nettoyage, la déduplication, le filtrage et la normalisation
- Construire et maintenir des jeux de données pour la recherche et l'entraînement de modèles
- Surveiller les performances du crawl, la couverture et la qualité des données ; itérer rapidement
- Collaborer avec les équipes de recherche pour aligner la collecte de données avec les besoins de modélisation
- Optimiser l'infrastructure pour le coût, la latence et la fiabilité
Préféré / Bonus
- Expérience avec des pipelines NLP ou la curation de jeux de données pour le ML
- Familiarité avec les données de pré-entraînement LLM ou les systèmes de récupération
- Expérience avec les navigateurs headless (par exemple, Chrome DevTools Protocol, Playwright, Puppeteer)
- Connaissance des systèmes de proxy, de la rotation d'IP et de l'orchestration de requêtes à grande échelle
- Contexte en évaluation de la qualité des données ou en benchmarking
- Expérience d'exécution de charges de travail sur une infrastructure cloud ou bare-metal
Ce que ce rôle implique
- Opérer à la frontière de l'échelle et de la fiabilité
- S'adapter à des environnements web en constante évolution
- Équilibrer le débit, la couverture et la qualité des données
- Prendre en charge les pipelines d'acquisition de données de bout en bout Évaluation
Critères
- Capacité à concevoir des systèmes qui évoluent sans dégrader la qualité
- Résolution de problèmes pratiques dans des contraintes du monde réel
- Vitesse d'itération et appropriation
- Améliorations mesurables de la couverture des données, de la qualité ou de l'efficacité
Exemples de projets
- Construire un crawler distribué pour un projet web de haute qualité mis à jour en continu
- Concevoir un système pour classifier et filtrer des milliards de pages pour le pré-entraînement
- Extraire des données structurées de sites dynamiques riches en JavaScript à grande échelle
- Améliorer la déduplication et la notation de qualité sur des jeux de données multimodaux
Rémunération
Basé sur l'expérience et la capacité démontrée à opérer à grande échelle
Rémunération. Vous recevrez un salaire compétitif, des avantages sociaux et un ensemble d'actions.
