detectTextExtractableFileKind
判断文件能否抽成纯文本,以及走哪条路径:PDF、Word、Markdown、光栅图(OCR)、UTF-8 源码/配置。
导出
typescript
type TextExtractableFileKind = 'txt' | 'md' | 'pdf' | 'docx' | 'image'
function detectTextExtractableFileKind(
filename: string,
mimeType?: string | null,
): TextExtractableFileKind | null
function isTextExtractableFileName(filename: string): boolean
const TEXT_EXTRACTABLE_FILE_ACCEPT: string判定顺序
- DOCX
- Markdown
- 光栅图(
isRasterImageFile,不含 SVG) - 纯文本(
isPlainTextFileName/isPlainTextMimeType)
未知后缀且 MIME 也不是文本时返回 null;调用方可再用 bytesLookLikeUtf8Text 做字节兜底。