2m read
大模型网页抓取原理
aiweb
大模型总结网页,不是本地抓取,是服务端代抓。
流程:
text你给 URL → 云端服务器发出 HTTP 请求 → 目标网站返回 HTML ↓ HTML 转纯文本/Markdown ↓ 小模型按 prompt 提取关键信息 → 返回给你
几个容易搞混的点:
- 请求不是从本地发的。IP 是大模型服务商的服务器。
- 不会使用本地登录态。服务端没有 cookie、JWT、session,对目标网站是匿名访客。
- 每次请求独立,上次抓的内容不会带到下次。
能抓和不能抓的:
| 情况 | 结果 |
|---|---|
| 公开网页(如维基百科) | 直接能抓 |
| 带分享链接的页面 | 部分内容未登录也能看,可能成功 |
| 必须登录才能看的 | 失败,拿不到正文 |
登录后内容的处理方式:
- F12 复制 HTML:Elements 面板右键内容节点 → Copy outerHTML,直接贴给模型。
- 另存为本地:
Cmd+S存 HTML,或者Cmd+P存 PDF,再丢给模型读。 - 截图:把图存本地,模型能直接识别文字。
- 搭浏览器 MCP 工具:Puppeteer/Playwright MCP server,复用本地浏览器 profile,保留登录态。
Chat 模式模型本身离线,训练数据也有截止日期。平台通过 WebFetch / WebSearch 这些工具让它能「上网」——本质就是函数调用:模型输出 URL,平台去抓,再把结果塞回上下文。
JWT、session 留在本地设备上,除非主动配了 MCP 工具让服务器访问浏览器。