Word2vec et similarite
Technique des mots proches
Derniere mise a jour : 3 juillet 2026
Principe general
Quand un joueur propose un mot qui n'est pas exactement present dans l'article, Salon Maestro cherche si ce mot est proche d'un mot encore masque. Le but n'est pas de donner la reponse exacte, mais d'afficher un indice utile au-dessus du mot cible quand la proposition est semantiquement voisine.
Origine du modele
Le rapprochement semantique principal utilise des embeddings francais word2vec crees et publies par Jean-Philippe Fauconnier sous le titre "French Word Embeddings". Le modele utilise par defaut est issu de la famille frWac2Vec : frWac 200 dimensions CBOW cutoff 100. Les modeles sont presentes sur la page publique French word embeddings models et distribues sous licence CC-BY 3.0 avec attribution.
Credit et droit d'utilisation
Attribution du modele utilise : Fauconnier, Jean-Philippe. "French Word Embeddings". 2015. https://fauconnier.github.io/#data.
La licence CC-BY 3.0 autorise la copie, la redistribution et les adaptations, y compris dans un projet public ou commercial, a condition de conserver une attribution raisonnable, un lien vers la licence et d'indiquer les modifications effectuees. Dans Salon Maestro, les vecteurs du modele sont normalises puis importes dans une collection Qdrant privee, sans redistribution du fichier binaire dans l'application.
Conclusion pratique : Salon Maestro peut utiliser ces vecteurs tant que l'attribution a Jean-Philippe Fauconnier, le lien vers la source, le lien vers la licence CC-BY 3.0 et la mention des transformations restent visibles.
Cette attribution ne signifie pas que Jean-Philippe Fauconnier approuve Salon Maestro. Les modeles sont fournis sans garantie ni support specifique par leur auteur.
Pourquoi le modele complet n'est pas charge dans le Worker
Le fichier frWac2Vec skip-gram de 500 dimensions pese environ 298 Mo. Il a ete importe une seule fois dans une collection Qdrant distante contenant plus de 140 000 mots. Il n'est donc jamais charge dans le navigateur ni embarque dans le Worker temps reel.
A chaque proposition, le Worker envoie seulement une recherche filtree a Qdrant. Il n'y a plus d'etape d'indexation ou de prechargement lors de la premiere proposition.
Calcul d'une proximite
Pour chaque proposition, le serveur normalise le mot : minuscules, accents retires, ponctuation ignoree. Si le mot existe dans Qdrant, son vecteur est compare aux vecteurs des mots jouables encore presents dans l'article. La mesure utilisee est la similarite cosinus : plus les deux vecteurs pointent dans la meme direction, plus les mots ont ete observes dans des contextes proches.
Tous les voisins atteignant 50 % sont affiches au-dessus des mots masques correspondants. Pour une proposition de quatre lettres ou moins, le seuil passe a 70 % afin de limiter les faux positifs. Pour un meme mot masque, seul le meilleur pourcentage est conserve : un indice moins proche ne remplace pas un indice deja plus fort.
Exemple
Si l'article contient le mot "physique" et qu'un joueur propose "science", word2vec peut detecter que les deux mots apparaissent souvent dans des contextes voisins. Le jeu peut alors afficher "science" au-dessus de "physique" comme indice proche, sans reveler le mot exact.
Secours lexical
Si Qdrant ne trouve rien d'assez solide, Salon Maestro garde un second niveau de recherche avec JeuxDeMots pour certains synonymes. Ce secours est borne par un timeout court afin de ne pas bloquer la partie si le service externe ne repond pas.
Limites connues
- Un mot absent de la collection Qdrant ne peut pas profiter de la similarite vectorielle.
- Les rapprochements dependent du corpus d'entrainement et peuvent parfois surprendre.
- Les formes tres courtes ou ambigues sont filtrees plus strictement pour eviter les faux positifs.
- Le score est un indice de jeu, pas une mesure linguistique absolue.