HTML 转 Markdown
把 HTML 或复制的网页内容转成干净的 Markdown。可去掉图片和链接,并显示能为 LLM 节省多少 token。全部在浏览器中完成,不上传。
HTML 或复制的网页内容
复制网页的一部分粘贴到这里,格式会自动作为 HTML 被捕获。也可以直接粘贴 HTML 源码。
Markdown
使用方法
有两种输入方式。在网页上选中需要的部分,复制后粘贴到左侧框里:浏览器会在后台把带格式的内容以 HTML 形式一起交出来,这个工具会接收那份 HTML 而不是纯文本。也可以直接粘贴 HTML 源码,比如从"查看源代码"或保存的文件里拿到的。无论哪种方式,右侧都会出现 Markdown 和复制按钮,标题、列表、链接、代码和表格都会保留。
这么做最常见的原因,是把网页内容交给 ChatGPT、Claude 或 Gemini。直接从浏览器复制的页面带着导航、内联样式、跟踪脚本和层层嵌套的标签,语言模型完全用不上,而每一个字符都在消耗上下文窗口和费用。Markdown 只保留模型真正阅读的结构、剥掉包装,同一篇文章通常能缩到原来的几分之一 token。结果下方那一行显示的是用 GPT-4o、GPT-4.1 所用的 o200k_base 分词器统计的转换前后 token 数;其他模型略有差异,但比例是有代表性的。
两个选项可以再精简。"去掉图片"会整体删除图片标签,因为读文本的模型看不到图片,URL 只会增加噪音。"去掉链接"保留链接文字、丢弃网址,在每隔一句就有链接的页面上效果很明显。脚本、样式、内联 SVG 图标、注释和文档头部总是会被删除。HTML 表格会变成 GitHub 风格的竖线表格;嵌套在表格里的表格因为 Markdown 无法表达,会被展平成文字。
所有处理都在浏览器里完成。粘贴的内容只从剪贴板事件中读取,不会发送到任何地方,所以公司内网 wiki 或需要登录的文档也可以放心转换。特别长的页面会稍慢一点,因为分词器要把全文走两遍;超过一百万字符的输入会被拒绝,请先拆开。