反爬规则一变,任务就中断
规则和验证码更新后,维护成本不断叠加。
50 个常见问题
访问限制、动态内容和地区差异,让数据采集变成持续的基础设施维护。
规则和验证码更新后,维护成本不断叠加。
浏览器检查没有执行或没有返回通行结果。
挑战令牌失效后,原本正常的会话突然被拦截。
浏览器身份变化导致会话失去信任。
即使页面正常渲染,自动化信号仍会触发封锁。
页面加载前,托管服务商的地址段已被拒绝。
难以稳定验证价格、内容和结果。
连续请求离开原代理,无法保持会话连续性。
登录或结账在验证后丢失 CSRF 与会话上下文。
WAF 拦截页替代目标内容,但只提供有限诊断信息。
批量任务中代理或目标域名偶尔无法解析。
请求协商出的协议特征与真实浏览器不同。
安全规则向自动化流量返回了另一套页面。
数据只有在滚动或用户交互后才出现。
iframe 内的受保护流程受到同源限制。
内容拦截或指纹保护让验证资源无法运行。
响应只包含同意弹层,没有真正的目标内容。
设备信号选择了不同布局或内容版本。
请求跨域后,认证请求头或 Cookie 消失。
完整文档传输结束前连接已经关闭。
分析脚本、流式连接或长轮询持续占用网络。
下一页依赖的本地存储状态在请求之间消失。
多次尝试继续复用已被拒绝的 IP 或浏览器身份。
现有代理无法稳定访问指定地区的网站。
管道缺少内容校验,无法区分拒绝页和真实结果。
完成验证后页面立即再次要求验证。
后续请求因缺少验证状态再次被挑战。
挑战和验证使用不同地址,导致验证结果无效。
网络层信号与声明的浏览器客户端不一致。
并发量超过目标网站的速率限制。
原本可用的地址在持续请求后被封锁。
目标网站识别出的地区与请求地区不同。
Cookie 或存储状态没有跨受保护页面保留。
安全、地区和登录跳转不断把请求送回前页。
连接已经建立,但受保护页面始终不可用。
证书链、协议支持或代理拦截阻止安全连接。
状态码看似成功,任务却把拦截页当成有效内容。
价格和库存等异步信息经常缺失。
页面文档能打开,但填充内容的接口请求被拒绝。
嵌入式浏览器缺少所需存储、脚本或浏览器能力。
页面安全策略不允许所需挑战资源执行。
Accept-Language 导致字段、标签或跳转目标发生变化。
公开页面正常,但账户页面只返回登录界面。
Content-Encoding 与实际响应内容不一致。
字体、图片或异步区域仍处于加载状态。
应用缓存响应与当前网络页面不一致。
行为防护在形成请求模式后才开始拦截。
请求头或正文传输过程中隧道意外关闭。
访问成功后仍会因目标服务不稳定而失败。
团队被迫维护非核心基础设施。
自动处理访问限制、动态渲染与输出清洗,让特定 URL 的公开内容稳定进入你的数据管道。
后台实时应对 Cloudflare、PerimeterX、DataDome 等主流反爬系统的规则更新,你的代码无需任何改动。
基于真实 Chrome 执行 JavaScript,等待动态内容加载完毕后再返回,SPA 页面、异步加载数据完整可达。
通过 country 参数指定出口 IP 所在国家,模拟当地用户访问,获取地区限定的价格、内容和搜索结果。
HTML(完整原始内容)、Markdown(清洁文本,去除噪音,适合 AI 处理)、截图 PNG(Base64 编码,视觉验证用)。
请求失败自动切换 IP 重试,只有最终成功才计费。成本完全可预测,不会因目标网站波动导致额外费用。
传入账号 Cookie 维持登录状态,访问登录后才可见的内容——LinkedIn 档案、会员页面、个性化结果均可抓取。
输入目标 URL(或搜索关键词)、所需参数——3 行代码完成。支持 Python、Node.js、cURL。
选择最优 IP → 模拟浏览器指纹 → 执行 JS → 处理验证码 → 失败时切换 IP 重试。你不需要知道这些发生了什么。
按你指定的格式返回:Markdown 正文、完整 HTML 或页面截图。成功才计费,响应体直接包含内容,无二次请求。
User-Agent
Auto-Adaptive
Proxy Tunnel
Smart IP
需要抓取特定 URL 的页面内容时,网页解锁器是最直接的选择。
抓取 Amazon、eBay 等平台的商品价格、库存、评论。成功率高达 99%,失败不扣费。
抓取 TikTok、Instagram、Reddit 的帖子和评论,支持 Cookie 会话,Markdown 格式直出。
抓取 LinkedIn 职位、公司主页、人才档案,支持 Cookie 登录态,比官方 API 节省 80% 成本。
大规模批量采集公开网页文本,Markdown 格式返回,清洗成本接近零,直接送入 LLM 训练管道。
抓取新闻媒体、博客、论坛的文章正文,去除广告和导航噪音,内容直接可读。
抓取链家、安居客、Boss 直聘等平台的结构化数据,价格、户型、JD、薪资范围完整提取。
LIVE RESPONSE
自动处理 Cloudflare、验证码、动态指纹、JS 渲染——把任意 URL 变成干净的 HTML、Markdown 或截图,无需维护代理池和反爬规则。
{ "status": "success", "url": "https://example.com", "format": "markdown", "content": "# Product title\n\n$49.00...", "credits_used": 1}只为有效数据付费
Clawoxy 采用“成功才计费”模式——只有请求最终成功并返回有效内容才扣除积分。因 IP 被封触发重试、目标网站返回错误或超时导致的失败,均不扣积分。重试过程对你透明,账单只显示成功次数。
Markdown 格式会保留正文段落、标题层级、列表、表格、链接文本、图片 alt 描述。会过滤导航栏、侧边栏、广告、Cookie 横幅、页脚等页面噪音。对于需要原始 HTML 结构(如自定义解析器)或需要视觉验证(如广告展示确认)的场景,建议选择 HTML 或 screenshot 格式。同一次请求消耗积分相同,可按需选择。
请求参数中传入 wait_for 字段,值为 CSS 选择器,例如 "wait_for": "#price-box"。Clawoxy 会在 Chrome 中等待该元素出现在 DOM 中后再返回页面内容,适合价格、库存等通过异步请求延迟加载的元素。此参数仅在 render=true 时生效,超时时间由 timeout 参数控制(默认 30 秒)。
入门版默认每秒 5 次并发,专业版每秒 20 次,企业版不限并发。如果你的任务需要短时间处理大批量 URL,建议使用专业版或联系企业版,我们会为高并发场景配置专属资源,确保稳定吞吐率。