资讯动态

qiaomu-anything-to-notebooklm 输入检测机制:detect_input_type 如何一眼判断 15 种内容格式

发布时间:2026/9/3 10:27:52 来源:尧图企业网站定制
qiaomu-anything-to-notebooklm 输入检测机制detect_input_type 如何一眼判断 15 种内容格式【免费下载链接】anything-to-notebooklmClaude Skill: Multi-source content processor for NotebookLM. Supports WeChat articles, web pages, YouTube, PDF, Markdown, search queries → Podcast/PPT/MindMap/Quiz etc.项目地址: https://gitcode.com/GitHub_Trending/an/qiaomu-anything-to-notebooklmqiaomu-anything-to-notebooklm 是一个多源内容智能处理器微信文章、网页、YouTube、PDF、Markdown、搜索关键词等输入经它之手统一进入 NotebookLM再生成播客、PPT、思维导图、Quiz 等格式。一切处理开始前的关键一步是输入检测——由 main.py 中的detect_input_type函数完成。本文带你逐段看懂这套15 种格式识别机制新手也能快速理解。一句话看懂输入检测是如何工作的整个检测逻辑可以概括为URL 判定 → 文件存在性判定 → 扩展名判定三步代码集中在 main.py先看是不是链接以http开头则按域名匹配微信、YouTube、播客平台、X/Twitter……匹配不上就归为普通网页url再看文件是否存在用Path.expanduser()解析路径支持~开头的家目录文件不存在则视为搜索关键词search最后看扩展名把后缀统一转小写后对照一张扩展名 → 类型映射表程序入口 main.py 在启动时立即调用该函数并打印第一行提示 检测到输入类型: weixin这一行输出既是给用户的反馈也是排查格式没被正确识别问题的最快入口。15 种输入类型与判定规则一览表下表覆盖项目 README 宣称的 15 种内容源以及每种输入被判定出的类型标签type label#输入示例判定类型后续处理方式1mp.weixin.qq.com链接weixinMCP 浏览器模拟抓取绕过反爬2youtube.com/youtu.be链接youtube直接交给 NotebookLM 提取字幕3小宇宙 / 喜马拉雅 / B站 链接podcastGet笔记 API 转写为 TXT4x.com/twitter.com链接x_twitter代理级联抓取 → fetch_url.sh5其他http(s)链接urlnotebooklm source add直接添加6book.epubepubebooklib 提取全文 → TXT7*.pdfdocument全文提取扫描件走 OCR8*.mddocument原生直接上传9*.txtdocument直接上传10.docx/.pptx/.xlsxofficemarkitdown 转 Markdown11.jpg/.png/.gif/.webp等imagemarkitdown OCR 识别文字12.mp3/.wavaudiomarkitdown 语音转文字13archive.zipzip解压后批量转换14本地不存在的路径即搜索词searchWeb 搜索汇总 → TXT15无匹配扩展名的文件unknown提示不支持并退出 注意15 种内容源与13 个类型标签的关系PDF/TXT/MD 同归document图片、音频、Office 各自归为一类——类型标签是处理分支内容源是用户视角两者并不一一对应。三个容易忽略的细节1️⃣ URL 判定是顺序匹配域名判断按书写顺序短路命中mp.weixin.qq.com先于通用url判定youtu.be短链与youtube.com并列处理。这也是为什么微信文章不会被误判成普通网页。2️⃣ 不存在的路径 搜索关键词这是设计上最巧妙的地方见 main.py输入既不是 URL、本地又找不到同名文件时不报错而是当作搜索关键词交给 Web 搜索汇总。也就是说AI 发展趋势 2026这类纯文字输入正是靠这条兜底路径进入流程的。3️⃣ 子串匹配的小坑x.com与twitter.com使用的是子串包含判断x.com in input_path。绝大多数场景没问题但域名中恰好含x.com字样的站点如myx.com会被误判为推文——理解这一点你就读懂了这 13 行判定代码里隐藏的所有边界情况。类型判定之后程序如何分发检测到类型后main.py 按类型进入对应处理分支epub→ main.py 的extract_epub_to_txt提取全文再上传document→ 直接notebooklm source add上传podcast→ 调用 scripts/get_podcast_transcript.py 获取带时间戳的转写约 2-5 分钟x_twitter→ 执行 scripts/fetch_url.sh走 r.jina.ai → defuddle.md → agent-fetch 的代理级联url→ 直接添加为 NotebookLM 内容源付费墙由脚本的 6 层级联策略自动绕过⚠️ 一个实用提示main.py命令行目前实现了上述 5 个主分支其余类型office、image、audio、zip、search、unknown在 CLI 层会提示不支持的输入类型。完整的 15 种内容源路由由 Claude Skill 侧完成详细映射表可查阅 SKILL.md 的识别内容源类型章节——检测函数负责认出它Skill 负责处理它。快速上手三步验证输入检测跑一次真实输入python3 main.py 你的链接或文件路径第一行 检测到输入类型即检测结果核对类型是否符合预期对照上表若输出search而你本想上传文件多半是文件路径写错了检查依赖环境运行 check_env.py 做 13 项环境检查配合 install.sh 一键装齐依赖小结detect_input_type用不到 30 行代码以URL → 存在性 → 扩展名三级判定覆盖了 15 种内容源其中不存在的路径即搜索词的兜底设计尤其值得借鉴。理解了这张类型表你就掌握了 qiaomu-anything-to-notebooklm 从输入到播客/PPT/思维导图全流程的第一块拼图。【免费下载链接】anything-to-notebooklmClaude Skill: Multi-source content processor for NotebookLM. Supports WeChat articles, web pages, YouTube, PDF, Markdown, search queries → Podcast/PPT/MindMap/Quiz etc.项目地址: https://gitcode.com/GitHub_Trending/an/qiaomu-anything-to-notebooklm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价