Skip to content

detectTextExtractableFileKind

判断文件能否抽成纯文本,以及走哪条路径:PDF、Word、Markdown、光栅图(OCR)、UTF-8 源码/配置。

导出

typescript
type TextExtractableFileKind = 'txt' | 'md' | 'pdf' | 'docx' | 'image'

function detectTextExtractableFileKind(
  filename: string,
  mimeType?: string | null,
): TextExtractableFileKind | null

function isTextExtractableFileName(filename: string): boolean

const TEXT_EXTRACTABLE_FILE_ACCEPT: string

判定顺序

  1. PDF
  2. DOCX
  3. Markdown
  4. 光栅图(isRasterImageFile,不含 SVG)
  5. 纯文本(isPlainTextFileName / isPlainTextMimeType

未知后缀且 MIME 也不是文本时返回 null;调用方可再用 bytesLookLikeUtf8Text 做字节兜底。