通过 MCP 服务器把各类网页数据连接器变成 AI 代理的原生工具
MCP 把每个连接器封装为代理可调用的原生工具,免去自行处理限流与 HTML 解析的管道
方案简介
本方案介绍如何把 SurfSense 的实时网页数据能力通过 MCP 服务器接入 AI 代理(如 Claude、Cursor 或自研代理框架)。核心问题是:代理回答「Reddit 上大家怎么看这个产品」「这十家店的评论到底在抱怨什么」这类问题时,缺乏可信的实时数据来源——官方平台 API 限流且按企业定价,爬虫管道脆弱,用 LLM 驱动浏览器每页都烧时间和 token。SurfSense 提供一组统一的数据原语:每个连接器都是返回结构化 JSON 的 REST 端点,覆盖 Reddit、YouTube、Instagram、TikTok、Google Maps、Google Search、Indeed、Amazon、Walmart 以及任意网页抓取,并提供 MCP 服务器把所有连接器暴露为代理可原生调用的工具。适合需要给代理补充实时开放网络数据的开发者与代理框架作者。
亮点与能力
- 每个连接器都是返回结构化 JSON 的 REST 端点:帖子、评论、字幕、评论、SERP、页面
- 所有连接器通过 MCP 服务器暴露为原生工具(如
surfsense_reddit_scrape、surfsense_google_search) - Reddit 连接器绕过官方 API 限流获取帖子、评论与子版块流
- Indeed 提供含薪资和完整描述的公开职位,按搜索或公司查询
- 外部 MCP 连接器可把任意 MCP 服务器接入代理,并为 Notion、Slack、Jira 等提供一键 OAuth
- 代理工具链内置重试、结构化输出与额度计量
- 按实际返回条目计费,抓取按成功抓取页计费,失败调用不收费
- 连接器目录持续扩展,新数据源以同一 API 与 MCP 服务器上的类型化端点形式上线
组成与分工
- SurfSense MCP Server:把全部连接器封装为 MCP 原生工具,供 Claude、Cursor 等代理调用,可使用托管版或在本地从
surfsense_mcp运行 - REST 连接器:每个数据源(Reddit、YouTube、Amazon 等)一个类型化端点,返回结构化 JSON
- Claude / Cursor:作为 MCP 客户端代理,把连接器当作原生工具调用完成研究任务
- External MCP Connectors:把用户自己的任意 MCP 服务器接入代理,支持 Notion、Slack、Jira 等一键 OAuth
- API Key / 鉴权头:通过
Authorization: Bearer头验证请求身份
前置要求
- 需要 SurfSense API Key(云账户新账户附赠 $5 免费额度,无订阅)
- 支持任意可发 HTTP 请求的语言,官方连接器页面提供 Python、JavaScript、Go、PHP、Ruby、Java、C# 的复制粘贴示例
- 若使用本地 MCP 服务器,可从仓库的
surfsense_mcp目录运行
实施步骤
1. 从代码调用连接器
每个连接器都是一个可用任意语言调用的 REST 端点,带上你的 SurfSense API Key 即可。以 Reddit 抓取为例:
bash
curl -X POST "$SURFSENSE_API_URL/workspaces/$WORKSPACE_ID/scrapers/reddit/scrape" \
-H "Authorization: Bearer $SURFSENSE_API_KEY" \
-H "Content-Type: application/" \
-d '{
"search_queries": ["your brand"],
"community": "SaaS",
"sort": "top",
"time_filter": "week"
}'
2. 通过 MCP 把工具交给代理
在 Claude、Cursor 或自研代理框架的 MCP 配置中添加 SurfSense MCP 服务器:
{
"mcpServers": {
"surfsense": {
"url": "https://mcp.surfsense.com/mcp",
"headers": { "Authorization": "Bearer ${SURFSENSE_API_KEY}" }
}
}
}
配置完成后,代理即可把每个连接器当作原生工具调用。完整工具列表见官方 MCP 服务器页面,也可从 surfsense_mcp 目录在本地运行服务器。
使用与配置要点
- 云端使用:前往 surfsense.com 登录,用自然语言直接向代理要实时网页数据,新账户附赠 $5 免费额度
- 也可不写代码,直接在支持 MCP 的客户端(Claude、Cursor)中让代理调用
surfsense_reddit_scrape等工具 - 验证成功:代理能以原生工具形式列出并调用各连接器,返回结构化 JSON 结果
- 计费方式:按实际返回条目计费,抓取按成功页计费,失败的调用从不计费
注意事项与常见问题
- 云端版按量计费,需关注额度消耗;自托管版计费关闭,抓取与代理运行只受硬件和你自带模型 Key 的限制
- 各平台连接器各有范围(如 Instagram 仅公开资料/帖子/Reels,TikTok 无需 Research API 审批),使用前确认目标数据在连接器能力内
- 每个新数据源都以同一 API 与 MCP 服务器上的类型化端点形式上线,目录仍在扩展中
优缺点
- ✓ 连接器即原生工具开箱即用
- ✓ 内置重试与结构化输出
- ✕ 按返回条目计费
- ✕ 依赖平台连接器覆盖范围
出处
本方案挖掘自开源项目 MODSetter/SurfSense,方案内容与实施命令均来自其 README 原文。
本方案由真实开源项目挖掘整理,实施命令均来自其 README 原文,安装使用请遵循项目开源协议。