{"_id":"@123pzy/web-scraper","name":"@123pzy/web-scraper","dist-tags":{"latest":"1.0.0"},"versions":{"1.0.0":{"name":"@123pzy/web-scraper","version":"1.0.0","description":"网页爬取MCP服务器 - 获取和解析网页内容","type":"module","main":"./dist/index.js","types":"./dist/index.d.ts","bin":{"web-scraper-server":"dist/index.js"},"scripts":{"build":"tsc","prepublishOnly":"npm run build","dev":"tsc --watch"},"keywords":["mcp","model-context-protocol"],"author":{"name":"123pzy"},"license":"MIT","dependencies":{"@modelcontextprotocol/sdk":"^1.25.3","cheerio":"^1.0.0","zod":"^4.3.5"},"devDependencies":{"@types/node":"^25.0.9","typescript":"^5.9.3"},"packageManager":"pnpm@10.28.1+sha512.7d7dbbca9e99447b7c3bf7a73286afaaf6be99251eb9498baefa7d406892f67b879adb3a1d7e687fc4ccc1a388c7175fbaae567a26ab44d1067b54fcb0d6a316","_id":"@123pzy/web-scraper@1.0.0","gitHead":"6c7f8c70fc9683bba69cb25a8f292fabb8f0ce38","_nodeVersion":"20.19.2","_npmVersion":"10.8.2","dist":{"integrity":"sha512-zAwkBS9AyTFEHJIv6qKCa4S3rdsFPHnq5zYNUwT2PAPu5tQLYmz9VEse2eOtuGUi21YIZ8MUn2MAhLxKHZ1G9Q==","shasum":"f6b38ae568a7bc8c0d7ab5377a5a3bc040f88a31","tarball":"https://registry.npmjs.org/@123pzy/web-scraper/-/web-scraper-1.0.0.tgz","fileCount":5,"unpackedSize":16590,"signatures":[{"keyid":"SHA256:DhQ8wR5APBvFHLF/+Tc+AYvPOdTpcIDqOhxsBHRwC7U","sig":"MEYCIQCRFLTgd5iGSseU8LKB2VkpfHNg/IuCDLz21gCbT26/+AIhAI2oE+ZSL4iKvrUDejyk3dYpogZMmZCEtDlg0CGgU/7E"}]},"_npmUser":{"name":"123pzy","email":"zeyupan@163.com"},"directories":{},"maintainers":[{"name":"123pzy","email":"zeyupan@163.com"}],"_npmOperationalInternal":{"host":"s3://npm-registry-packages-npm-production","tmp":"tmp/web-scraper_1.0.0_1772373707574_0.00047266638255205606"},"_hasShrinkwrap":false}},"time":{"created":"2026-03-01T14:01:47.448Z","1.0.0":"2026-03-01T14:01:47.733Z","modified":"2026-03-01T14:01:47.904Z"},"maintainers":[{"name":"123pzy","email":"zeyupan@163.com"}],"description":"网页爬取MCP服务器 - 获取和解析网页内容","keywords":["mcp","model-context-protocol"],"author":{"name":"123pzy"},"license":"MIT","readme":"# @123pzy/web-scraper\n\n一个基于 Model Context Protocol (MCP) 的网页爬取服务器，提供获取和解析网页内容的工具。\n\n## 功能特性\n\n- 🔍 获取和解析网页内容\n- 📝 提取结构化数据（标题、段落、链接、图片）\n- 🛡️ 内置安全限制（超时控制、大小限制）\n- 🚀 支持作为 MCP 服务器使用\n- 📦 提供 CLI 命令\n\n## 安装\n\n```bash\nnpm install @123pzy/web-scraper\n```\n\n## 使用方法\n\n### 作为 MCP 服务器\n\n在 MCP 客户端配置文件中添加：\n\n```json\n{\n  \"mcpServers\": {\n    \"web-scraper\": {\n      \"command\": \"npx\",\n      \"args\": [\"-y\", \"@123pzy/web-scraper\"]\n    }\n  }\n}\n```\n\n或使用全局安装：\n\n```bash\nnpm install -g @123pzy/web-scraper\n```\n\n配置文件中使用：\n\n```json\n{\n  \"mcpServers\": {\n    \"web-scraper\": {\n      \"command\": \"web-scraper-server\"\n    }\n  }\n}\n```\n\n## 提供的工具\n\n### fetch_webpage\n\n获取网页并返回结构化内容。\n\n**输入参数:**\n- `url` (string): 要获取的网页 URL\n\n**返回内容:**\n- 页面标题\n- 所有段落文本\n- 所有链接（包括 href 和文本）\n- 所有图片（包括 src 和 alt）\n\n**示例:**\n```json\n{\n  \"url\": \"https://example.com\"\n}\n```\n\n### fetch_webpage_raw\n\n获取网页的纯文本内容（移除脚本和样式）。\n\n**输入参数:**\n- `url` (string): 要获取的网页 URL\n\n**返回内容:**\n- 页面的纯文本内容（最多 2000 字符）\n\n## 安全限制\n\n- ✅ 仅支持 HTTP/HTTPS 协议\n- ⏱️ 请求超时：5 秒\n- 📏 响应大小限制：10MB\n- 🤖 使用标准浏览器 User-Agent\n\n## 提供的资源\n\n### docs://guide\n\n通过 MCP 访问的使用指南文档。\n\n## 技术栈\n\n- [Model Context Protocol SDK](https://github.com/modelcontextprotocol) - MCP 协议实现\n- [Cheerio](https://cheerio.js.org/) - HTML 解析\n- [Zod](https://zod.dev/) - 输入验证\n\n## 许可证\n\nMIT\n\n## 作者\n\n123pzy\n\n## 相关链接\n\n- [MCP 官方文档](https://modelcontextprotocol.io/)\n- [npm 包地址](https://www.npmjs.com/package/@123pzy/web-scraper)\n","readmeFilename":"README.md","_rev":"1-f25e4a2cd61956d28fba34816944b5ef"}