Connaissances

Imports et formats pris en charge

Types de fichiers ingérés par FlexyAgents, gestion des imports volumineux, images et médias avec enrichissement IA optionnel, et conseils éditoriaux pour que les fragments restent utiles après l’embedding.

importer pdfdocumentsbase de connaissancesimagesaudiovidéo

Les imports sont le moyen le plus rapide de démarrer une base lorsque votre contenu existe déjà en fichiers. FlexyAgents extrait le texte, le découpe pour l’embedding et l’attache aux bases de votre choix.

Les images peuvent passer par l’OCR plus une description optionnelle avec Gemini ; l’audio et la vidéo peuvent être transcrits lorsque Gemini est disponible — consultez Documentation → Connaissances → Vision IA, transcription et limites pour les quotas et BYOK.

La qualité compte toujours : les PDF OCR, tableaux complexes et présentations peuvent nécessiter un nettoyage pour une récupération fiable.

Formats pris en charge

Les formats bureautiques courants (Word, Excel, CSV), PDF, HTML/Markdown/JSON/XML, RTF, archives courantes (ZIP, RAR, TAR, GZ), images (JPEG, PNG, GIF, WebP, BMP, TIFF, extraction de texte SVG) et médias (p. ex. MP4, WebM, MP3, WAV, OGG) sont généralement pris en charge dans les interfaces habituelles.

Les listes exactes et tailles maximales peuvent évoluer — utilisez l’importeur du produit comme source de vérité. Certains types de fichiers (p. ex. 7z) peuvent être bloqués.

Les fichiers chiffrés ou protégés par DRM doivent être déchiffrés avant import.

  • PDF : privilégiez les PDF avec texte natif ; les scans dépendent davantage de l’OCR.
  • Images : noms de fichier explicites ; le texte alt dans le HTML crawlé aide même si la vision est désactivée.

Structurer pour la récupération

Utilisez des titres, des sections courtes et des intitulés explicites pour aligner les limites de fragment avec les concepts. N’enterrez pas les faits critiques uniquement dans des images sans texte alternatif.

Le contenu dupliqué entre fichiers augmente le bruit ; dédupliquez ou désignez un document canonique.

Volume et imports par lot

Les API et flux du tableau de bord peuvent accepter plusieurs fichiers par requête avec des limites de débit ; étalez les migrations massives pour éviter les timeouts et surveillez la file d’embedding.

En migration enterprise, combinez les imports avec des connecteurs lorsque le contenu continue d’évoluer dans le système source.

Mises à jour et versionnement

Réimportez les fichiers révisés lorsqu’il n’y a pas de connecteurs ; les remplacements volumineux peuvent prendre du temps avant ré-embedding.

Coordonnez avec le juridique lors de la suppression de contenu réglementé — supprimez ou archivez les sources de manière intentionnelle plutôt que de laisser des vecteurs obsolètes.

Construisez sur votre stack

Prêt à déployer des assistants fondés sur vos données ?

Démarrez un essai ou parlez-nous de vos besoins de déploiement, gouvernance et exigences entreprise.