문서 홈

지식

가져오기 및 지원 형식

FlexyAgents가 수집하는 파일 유형, 대용량 가져오기 처리, 선택적 AI enrichment가 포함된 이미지와 미디어, 임베딩 후에도 청크가 유용하도록 하는 편집 팁.

pdf 가져오기문서지식 베이스이미지오디오동영상

콘텐츠가 이미 파일로 존재하는 경우 가져오기는 지식 베이스를 가장 빠르게 구축하는 방법입니다. FlexyAgents는 텍스트를 추출하고 임베딩용으로 분할하며 선택한 베이스에 연결합니다.

이미지는 OCR에 더해 선택적으로 Gemini 설명을 거칠 수 있습니다. Gemini를 사용할 수 있는 경우 오디오와 동영상은 전사할 수 있습니다 — 할당량과 BYOK는 문서 → 지식 → AI Vision, 전사, 제한을 참조하세요.

품질은 여전히 중요합니다. OCR된 PDF, 복잡한 표, 슬라이드 덱은 확실한 검색을 위해 정리가 필요할 수 있습니다.

지원 형식

일반 오피스 형식(Word, Excel, CSV), PDF, HTML/Markdown/JSON/XML, RTF, 일반 아카이브(ZIP, RAR, TAR, GZ), 이미지(JPEG, PNG, GIF, WebP, BMP, TIFF, SVG 텍스트 추출), 미디어(예: MP4, WebM, MP3, WAV, OGG)는 일반 대시보드에서 지원됩니다.

정확한 허용 목록과 최대 파일 크기는 변경될 수 있습니다 — 제품 내 가져오기 도구를 정본으로 하세요. 일부 아카이브 유형(예: 7z)은 차단될 수 있습니다.

비밀번호 보호 또는 DRM 보호 파일은 가져오기 전에 복호화해야 합니다.

  • PDF: 텍스트 네이티브 PDF를 우선하세요. 스캔 PDF는 OCR 의존도가 높아집니다.
  • 이미지: 의미 있는 파일명을 지정하세요. 크롤한 HTML의 alt 텍스트는 Vision이 비활성화여도 도움이 됩니다.

검색을 위한 구조화

제목, 짧은 섹션, 명시적 제목을 사용하여 청크 경계가 개념과 일치하도록 하세요. alt 텍스트 없는 이미지에만 중요한 사실을 넣지 마세요.

파일 간 중복 콘텐츠는 노이즈를 증가시킵니다. 중복 제거하거나 정규 문서를 지정하세요.

볼륨 및 배치 가져오기

제품 API와 대시보드 흐름은 속도 제한과 함께 요청당 여러 파일을 받을 수 있습니다. 대규모 마이그레이션은 타임아웃을 피하기 위해 분산하고 임베딩 큐를 모니터링하세요.

엔터프라이즈 마이그레이션에서는 소스 시스템에서 콘텐츠가 지속적으로 업데이트되는 경우 가져오기와 커넥터를 결합하세요.

업데이트 및 버전 관리

커넥터를 사용할 수 없으면 개정 파일을 다시 가져오세요. 대규모 교체는 재임베딩에 시간이 걸릴 수 있습니다.

규제 대상 콘텐츠를 제거할 때는 법무와 조율하세요 — 오래된 벡터를 남기기보다 의도적으로 소스를 삭제하거나 아카이브하세요.

스택 위에 구축

근거 있는 어시스턴트를 출시할 준비가 되셨나요?

체험판을 시작하거나, 롤아웃, 거버넌스, 엔터프라이즈 요건에 대해 상담하세요.