Derniers événements

Plus de vidéos
Fil d'actualités / ChatGPT a construit son propre index de recherche

Publié le 08/09/2026 à 13:11:49 par Abondance

ChatGPT a construit son propre index de recherche

Ce qu'il faut retenir :

  • ChatGPT fait tourner sa propre famille d'index appelée Labrador, qui couvre le web général, le PDF, YouTube, l'actualité, arXiv, Wikipédia, le local, la finance, le juridique, le médical, le shopping et les images.
  • Un témoignage de Nick Turley (responsable de ChatGPT) lors du procès antitrust de Google confirme que ce projet remonte à 2023, avec un objectif initial ambitieux de répondre à 80 % des requêtes via cet index propriétaire dès la fin de cette même année.
  • ChatGPT teste actuellement en conditions réelles son propre index contre des résultats scrapés, notamment sur les résultats shopping, via plusieurs expériences A/B en cours.
  • Google et Microsoft restent des fournisseurs importants : ChatGPT s'appuie sur au moins huit prestataires externes en plus de son propre index, dont Yelp, TripAdvisor et Web IQ de Microsoft.

Labrador, une famille d'index plutôt qu'un simple raccourci vers Google

Entre le 21 mai et le 21 juillet 2026, un champ nommé result_source apparaissait directement dans les événements serveur (SSE) de ChatGPT, révélant l'origine exacte de chaque résultat. Ce champ ne prenait que quatre valeurs possibles : Labrador, Bright, Oxylabs et SERP. Trois de ces sources sont des prestataires de scraping externes. La première, Labrador, est l'index propriétaire d'OpenAI.

En réalité, Labrador n’est pas un index unique, mais plutôt un ensemble de sous-index spécialisés par catégorie :

  • Web général
  • PDF
  • YouTube
  • Actualité, avec des niveaux distincts pour le dernier jour, les sept derniers jours et le reste
  • arXiv
  • Wikipédia
  • Local
  • Finance, avec un sous-index dédié aux PDF financiers
  • Juridique
  • Médical
  • Shopping
  • Images

Cet index stocke des données similaires à celles d'un moteur de recherche classique comme Google : contenu complet des pages, date de crawl et date de publication. Cette architecture reproduit ce que Google a mis deux décennies à construire, à savoir un index web généraliste complété par des index verticaux spécialisés selon le type de contenu.

Des offres d'emploi qui confirment la construction d'un index propriétaire

Plusieurs offres d'emploi publiées par OpenAI apportent des indices concrets sur cette infrastructure.

  • Une offre de poste "Software Engineer, Foundations Search" mentionne explicitement la conception et l'exploitation de systèmes d'indexation, de pipelines de récupération et de couches de service.
  • Une offre pour un poste d'"Engineering Manager, Online Data Systems" va plus loin : l'équipe Online Data y est décrite comme responsable de la base de données en ligne centrale et des services d'indexation derrière les applications de production d'OpenAI, ChatGPT compris. Cette même offre évoque une infrastructure fonctionnant à l'échelle de l'exaoctet, répartie sur plusieurs régions et plusieurs clouds. Un exaoctet représente 10 puissance 18 octets, soit un 1 suivi de 18 zéros, une échelle qui ne se justifie pas pour un système qui se contenterait de relayer des requêtes vers l'index de quelqu'un d'autre.
  • Une troisième offre, centrée sur la récupération par embeddings, demande explicitement la conception de nouveaux objectifs d'entraînement d'embeddings, d'architectures de vector store scalables et de méthodes d'indexation dynamique, avec un travail sur des représentations denses, éparses et hybrides. La représentation éparse renvoie au vocabulaire du TF-IDF et du BM25, les techniques de classement lexical sur lesquelles Google lui-même s'est construit. Associée aux embeddings denses, cette combinaison correspond exactement à ce qu'il faut pour faire fonctionner une fusion de rang réciproque (RRF), un mécanisme documenté par Metehan Yesilyurt, chercheur GEO chez Peec AI.

Un projet qui remonte au procès antitrust de Google, en 2024

La construction de cet index n'est pas récente. Elle démarre au début de l'année 2024, au moment où Google constatait de son côté que les systèmes RAG réduisaient les hallucinations des modèles de langage.

Pour bâtir son propre index, ChatGPT avait besoin...