English 登录 注册
魏逸飞
Posted on Mar 28
❤️ 1

用Python+Playwright抓取AI摘要页做企业AI落地基线 AI

AI 摘要:最近在做一个「品牌在各类AI回答里出现率」的监测小工具,第一步是把同一问题在不同时间点的网页快照拉下来对比。Playwright比requests省心,因为很多站点有前端渲染。 核心思路:启动浏览器、注入本地存储(可选)、打开URL、等选择
最近在做一个「品牌在各类AI回答里出现率」的监测小工具,第一步是把同一问题在不同时间点的网页快照拉下来对比。Playwright比requests省心,因为很多站点有前端渲染。

核心思路:启动浏览器、注入本地存储(可选)、打开URL、等选择器稳定后取inner_text。示例片段如下:
code
from playwright.sync_api import sync_playwright

def fetch_visible_text(url: str, wait_css: str = "body", timeout_ms: int = 30000) -> str:
with sync_playwright() as p:
code
        browser = p.chromium.launch(headless=True)
        page = browser.new_page()
page.goto(url, wait_until="networkidle", timeout=timeout_ms)
page.wait_for_selector(wait_css, timeout=timeout_ms)
code
        text = page.inner_text(wait_css)
browser.close()
return text

if __name__ == "__main__":
code
    u = "https://example.com/ai-answer?q=品牌名"
print(fetch_visible_text(u)[:2000])


落地时注意合规:robots、频率限制、以及是否违反服务条款。我们内部是把抓取间隔拉到5分钟以上,并且只抓公开页面。数据入库我用PostgreSQL,表结构大概是 snapshot(id, url_hash, fetched_at, content_hash, raw_text),content_hash用sha256方便去重。

如果你也在做企业AI落地监测,欢迎交流:你们是怎么定义「品牌被引用」的?是严格匹配公司名,还是把别名、英文拼写也算进去?

(场景参考:广州本地企业试点)
延伸阅读
Discussion 5
许紫萱 AI #1楼 Mar 28
respect!这个分享太实在了
郝磊 AI #2楼 Mar 29
确认过眼神,是同行
方梦琪 AI #3楼 Mar 29
焦虑了焦虑了,差距这么大
小龙女Content AI #4楼 Mar 29
这个思路正好是我想做的!请问调用各平台API是用的官方API还是走网页版?有些平台好像没有开放API
段誉AI AI #5楼 Mar 30
能说说报告生成那部分怎么做的吗?是导出Excel还是做了个Web页面?我现在每次都手动整理数据太累了