Share to:

网页抓取

此條目没有列出任何参考或来源。 (2016年3月15日)
維基百科所有的內容都應該可供查證。请协助補充可靠来源以改善这篇条目。无法查证的內容可能會因為異議提出而被移除。

网页抓取（英語：web scraping）是一种从网页上获取页面内容的计算机软件技术。通常透過软件使用低级别的超文本传输协议模仿人类的正常访问。

网页抓取和网页索引极其相似，其中网页索引指的是大多数搜索引擎采用使用的机器人或网络爬虫等技术。与此相反，网页抓取更侧重于转换网络上非结构化数据（常见的是HTML格式）成为能在一个中央数据库和电子表格中储存和分析的结构化数据。网页抓取也涉及到网络自动化，它利用计算机软件模拟了人的浏览。网页抓取的用途包括在线的价格比较，联系人抓取，气象数据监测，网页变化检测，科研，混搭和Web数据集成。

技术层面

网络抓取用于自动化获取万维网上的信息

人工复制与粘贴：最好的网页抓取技术也比不上人类的手工复制与粘贴，尤其是在某些网站采取技术手段禁止自动化网页抓取的情况下，人工的复制与粘贴就成了唯一的解决方案。

文本搜索与正则表达式：文本搜索并且配合正则表达式可以有效的从页面上提取需要的内容。在基于UNIX的系统上可以使用grep，在其他平台或其他编程语言（例如Perl，Python）中也有相应的命令或语法。

基于HTTP编程：无论是静态网页还是动态网页均可以通过发送HTTP请求给服务器来获得，所以可以通过直接进行socket编程来实现。

HTML语法分析器：很多网站都是使用数据库来存储他们的数据，用户访问的时候再通过程序自动按照指定的格式生成，由于生成的这些网页都采用了相同的的格式或者模板等，所以可以通过对获取到的HTML页面使用语法分析器进行语法分析，然后就可以使用HTML标签来提取需要的内容。使用HTML语法分析器同文本搜索与正则表达式相比较程序更加的健壮，也免于构造复杂的正则表达式。

著名工具

参见

网络爬虫

Index: pl ar de en es fr it arz nl ja pt ceb sv uk vi war zh ru af ast az bg zh-min-nan bn be ca cs cy da et el eo eu fa gl ko hi hr id he ka la lv lt hu mk ms min no nn ce uz kk ro simple sk sl sr sh fi ta tt th tg azb tr ur zh-yue hy my ace als am an hyw ban bjn map-bms ba be-tarask bcl bpy bar bs br cv nv eml hif fo fy ga gd gu hak ha hsb io ig ilo ia ie os is jv kn ht ku ckb ky mrj lb lij li lmo mai mg ml zh-classical mr xmf mzn cdo mn nap new ne frr oc mhr or as pa pnb ps pms nds crh qu sa sah sco sq scn si sd szl su sw tl shn te bug vec vo wa wuu yi yo diq bat-smg zu lad kbd ang smn ab roa-rup frp arc gn av ay bh bi bo bxr cbk-zam co za dag ary se pdc dv dsb myv ext fur gv gag inh ki glk gan guw xal haw rw kbp pam csb kw km kv koi kg gom ks gcr lo lbe ltg lez nia ln jbo lg mt mi tw mwl mdf mnw nqo fj nah na nds-nl nrm nov om pi pag pap pfl pcd krc kaa ksh rm rue sm sat sc trv stq nso sn cu so srn kab roa-tara tet tpi to chr tum tk tyv udm ug vep fiu-vro vls wo xh zea ty ak bm ch ny ee ff got iu ik kl mad cr pih ami pwn pnt dz rmy rn sg st tn ss ti din chy ts kcg ve

Prefix: a b c d e f g h i j k l m n o p q r s t u v w x y z 0 1 2 3 4 5 6 7 8 9

Portal di Ensiklopedia Dunia

Kembali kehalaman sebelumnya