Connaissances

Vision IA, transcription et limites du forfait

Fonctionnement de la description d’images et de la transcription audio/vidéo lors des imports et des crawls, ce qui compte dans les quotas hébergés et comment les clés Gemini de l’organisation (BYOK) interagissent avec les limites.

reconnaissance d’imagetranscriptiongeminiquotabyokcrawl

FlexyAgents peut enrichir les connaissances avec l’IA au-delà du texte brut : Gemini Vision décrit les images pour que la recherche sémantique retrouve « des captures de la page de facturation », et Gemini transcrit podcasts ou vidéos de formation en texte consultable.

Sur l’infrastructure hébergée, votre abonnement peut inclure des plafonds mensuels distincts pour (1) la reconnaissance d’image lors des imports vs crawls, et (2) la transcription média lors des imports vs crawls. L’OCR (texte extrait des pixels) et les métadonnées de base ne remplacent pas la vision — ce sont des voies distinctes et ce n’est pas ce que mesurent ces quotas de « reconnaissance d’image ».

Ajouter une clé API Google Gemini valide pour votre organisation (Paramètres → Clés API LLM) achemine la vision et la transcription via votre compte Google, de sorte que les quotas hébergés FlexyAgents pour ces opérations ne s’incrémentent pas.

Les quatre compteurs hébergés (le cas échéant)

Les administrateurs configurent les limites dans le forfait. Les opérateurs consultent l’utilisation dans l’interface Connaissances : les imports affichent les compteurs côté import ; l’interface de crawl affiche les compteurs côté crawl lorsque le traitement média est activé.

Les limites utilisent des fenêtres de mois calendaire et les mêmes conventions « illimité » que les autres valeurs du forfait, où -1 signifie sans plafond.

  • Reconnaissance d’image — imports vers la base : compte la vision Gemini hébergée réussie sur les images importées.
  • Reconnaissance d’image — crawl web : compte la vision Gemini hébergée sur les images découvertes lors du crawl.
  • Transcription média — imports : compte la transcription Gemini hébergée sur les fichiers audio/vidéo importés.
  • Transcription média — crawl : compte la transcription Gemini hébergée sur les URL audio/vidéo récupérées pendant un crawl.

Comportement et erreurs lors des imports

Avant le traitement, la plateforme vérifie si l’inférence utilisera une clé Gemini hébergée ou celle de votre organisation. En inférence hébergée, si le plafond mensuel est déjà atteint, les nouveaux imports nécessitant vision ou transcription peuvent être refusés avec un message explicite (message de type HTTP 402 dans les API) plutôt que d’enregistrer silencieusement un contenu vide.

Si un forfait BYOK exige votre propre clé Gemini et qu’aucune n’est configurée, les étapes de vision et transcription sont ignorées ; vous pouvez toutefois obtenir du texte OCR ou des métadonnées de fichier le cas échéant.

  • Ajoutez une clé Gemini tôt si le marketing ou le support importe beaucoup de captures ou d’enregistrements.
  • Si les imports échouent avec un message de quota, augmentez les limites (admin), ajoutez une clé Gemini ou importez temporairement des formats orientés texte.

Crawl web : interrupteurs distincts

La configuration de crawl expose deux interrupteurs : reconnaissance d’image (Gemini Vision sur les images découvertes) et transcription audio/vidéo (Gemini sur les URL média récupérées). Vous pouvez crawler uniquement le HTML, uniquement les images, uniquement les médias ou toute combinaison.

Lancer un crawl qui active l’un ou l’autre requiert une configuration Gemini résolvable : FlexyAgents hébergé (selon l’environnement) ou votre clé Gemini d’organisation. Les crawls texte seul ne nécessitent pas Gemini.

  • Les requêtes héritées « traiter tout le média » sont mappées sur les deux interrupteurs pour compatibilité.
  • Lorsque les quotas de crawl hébergé sont épuisés, les images ou médias suivants dans ce crawl peuvent être traités uniquement avec OCR ou des marqueurs de substitution — conçu pour ne pas compter les appels API échoués contre les limites.

Ce que les opérateurs doivent surveiller

Combinez l’analytique avec la maintenance des connaissances : si les utilisateurs posent des questions sur les visuels, assurez-vous que la vision est active et que les quotas sont suffisants. Si les transcriptions échouent, améliorez la qualité audio ou ajoutez des Q&R relues par des humains pour les formulations critiques.

Documentation → Gouvernance → Clés API LLM explique la rotation et la conformité ; Documentation → Connaissances → Crawl web couvre la courtoisie, les URLs de départ et le périmètre.

Construisez sur votre stack

Prêt à déployer des assistants fondés sur vos données ?

Démarrez un essai ou parlez-nous de vos besoins de déploiement, gouvernance et exigences entreprise.