几个月前,几个朋友带着一个问题来找我。他们工作需要追踪初创公司的融资轮次,但他们没有 IT 背景。为了弄清楚谁获得了融资以及融资金额是多少,他们淹没在新闻稿、LinkedIn 帖子和付费数据库中。
作为朋友圈里的“技术担当”,他们向我求助。我想着写个简单的 Python 爬虫帮他们抓取数据就行了。能有多难?
事实证明,这是一场噩梦。这也正是我最终构建 ParheliaWeb 的确切原因。
爬虫的现实检验
这是我的第一个原型。这是很多开发者在只需快速获取数据时会写的那种脚本:
import requests
from lxml import html
def scrape_funding(url):
response = requests.get(url, headers={"User-Agent": "Mozilla/5.0"})
tree = html.fromstring(response.content)
# 这些选择器能用……直到网站重新设计
companies = tree.xpath("//h2[@class='company-name']/text()")
amounts = tree.xpath("//span[@class='funding-amount']/text()")
return [{"company": c, "amount": a} for c, a in zip(companies, amounts)]
我把它交给了他们,用了大约一周效果很好。然后现实给了我一记耳光:
- 网站增加了付费墙。
- Cloudflare 开始封锁我的 IP。
- 他们重新设计了网站,更改了所有的 CSS 选择器。
- 我发现金额的格式五花八门(“€5M”、“500万欧元”、“A轮金额 undisclosed”)。我的脚本根本不知道怎么处理。
- 同一条融资新闻被发在了三个不同的新闻网站上,我不得不进行去重。
我最终花在修复失效的选择器、标准化货币和处理速率限制上的时间,比实际帮助朋友的时间还要多。我这是在做一个基础设施项目,而不是数据工具。
API 方案(我现在使用的方法)
在意识到爬虫是一个巨大的时间黑洞之后,我决定不再与网站对抗,而是开始正确地结构化数据。我构建 ParheliaWeb,就是为了成为我朋友当初求助时我希望能拥有的那个 API。
只需 5 行简洁的 Python 代码,您就能获取完全相同的数据:
import requests
API_KEY = "your_api_key_here" # 在 parheliaweb.com 获取
response = requests.get(
"https://parheliaweb.com/v1/funding",
headers={"x-api-key": API_KEY},
params={
"max_age_days": 30,
"max_records": 10
}
)
data = response.json()
for round in data["results"]:
print(f"{round['company_name']} raised {round['funding_amount']} "
f"in {round['round_type']} ({round['announcement_date']})")
您将不再收到杂乱的文本字符串,而是获取干净、结构化的 JSON 数据,可以直接插入到您的应用程序或仪表盘中:
{
"user_tier": "pro",
"count": 10,
"max_age_days": 30,
"last_crawled": "2026-07-03T10:30:00Z",
"results": [
{
"company_name": "Acme AI",
"funding_amount": "$5 million",
"round_type": "Series A",
"announcement_date": "2026-06-15",
"source_url": "https://techcrunch.com/...",
"source_status": "active",
"sector": "Artificial Intelligence",
"currency": "USD",
"country": "US",
"lead_investor": "Sequoia Capital",
"is_extension": false,
"investor_count": "5"
}
]
}
无需解析。无需去重。当网站更改布局时,也不会在凌晨 4 点收到警报。它就是这么管用。
真实的成本对比
如果您正在决定是构建自己的数据管道还是使用 API,以下是我从实战中总结的经验:
| 因素 | 自己构建 | 使用 API |
|---|---|---|
| 获取首个结果的时间 | 2-4 周 | 5 分钟 |
| 日常维护 | 每周 5-10 小时 | 0 |
| 数据质量 | 参差不齐(需自行清洗) | AI 提取并经人工验证 |
| 覆盖盲区 | 您的问题 | 已处理 |
| 合规性 (GDPR 等) | 自行承担风险 | 已处理 |
| 成本 | 您的时间 + 基础设施 | €29/月 |
我的经验法则: 如果您的核心业务是数据收集,自己建。如果您的核心业务是使用数据,请使用 API。让别人去操心 CSS 选择器吧。
开始使用
📧 需要联系那些初创公司?
获取了干净的融资数据后,您需要联系他们而不至于落入垃圾邮件箱。了解我们是如何构建 邮箱验证 API 的,以提供透明、实时的 SMTP 验证和清晰的风险评分。
有问题?
我是 Andy,创始人。我只是个喜欢为人解决问题的 IT 仔。如果您对数据或 API 有任何疑问,随时给我发邮件。