当前位置: 首页 > news >正文

箱包商城网站建设WordPress一键采集插件

箱包商城网站建设,WordPress一键采集插件,设计服务网络建设方案,怎么在百度建立自己的网站简述以下的代码是使用python实现的网络爬虫#xff0c;抓取动态网页 http://hb.qq.com/baoliao/ 。此网页中的最新、精华下面的内容是由JavaScript动态生成的。审查网页元素与网页源码是不同。以上是网页源码以上是审查网页元素所以此处不能简单的使用正则表达式来获取内容。以…简述以下的代码是使用python实现的网络爬虫抓取动态网页 http://hb.qq.com/baoliao/ 。此网页中的最新、精华下面的内容是由JavaScript动态生成的。审查网页元素与网页源码是不同。以上是网页源码以上是审查网页元素所以此处不能简单的使用正则表达式来获取内容。以下是完整的获取内容并存储到数据库的思路及源码。实现思路抓取实际访问的动态页面的url – 使用正则表达式获取需要的内容 – 解析内容 – 存储内容以上部分过程文字解释抓取实际访问的动态页面的url在火狐浏览器中右键打开插件 使用**firebug审查元素** *(没有这项的要安装firebug插件)找到并打开**网络(NET)**标签页。重新加载网页获得网页的响应信息包括连接地址。每个连接地址都可以在浏览器中打开。本网站的动态网页访问地址是http://baoliao.hb.qq.com/api/report/NewIndexReportsList/cityid/18/num/20/pageno/1?callbackjQuery183019859437816181613_1440723895018_1440723895472正则表达式:正则表达式的使用有两种思路可以参考个人有关其简述python实现简单爬虫以及正则表达式简述更多的细节介绍可以参考网上资料搜索关键词 正则表达式 pythonjson参考网上有关json的介绍搜索关键词 json python存储到数据库参考网上的使用介绍搜索关键词 1mysql 2mysql python源码及注释注意使用python的版本是 2.7#!/usr/bin/python#指明编码#-*- coding: UTF-8 -*-#导入python库importurllibimporturllib2importreimportMySQLdbimportjson#定义爬虫类classcrawl1:def getHtml(self,urlNone):#代理user_agentMozilla/5.0 (Windows NT 6.1; WOW64; rv:40.0) Gecko/20100101 Firefox/40.0header{User-Agent:user_agent}requesturllib2.Request(url,headersheader)responseurllib2.urlopen(request)htmlresponse.read()returnhtmldefgetContent(self,html,reg):contentre.findall(html, reg, re.S)returncontent#连接数据库 mysqldefconnectDB(self):host192.168.85.21dbNametest1userrootpassword123456#此处添加charsetutf8是为了在数据库中显示中文此编码必须与数据库的编码一致dbMySQLdb.connect(host,user,password,dbName,charsetutf8)returndbcursorDBdb.cursor()returncursorDB#创建表SQL语言。CREATE TABLE IF NOT EXISTS 表示表createTableName不存在时就创建defcreatTable(self,createTableName):createTableSqlCREATE TABLE IF NOT EXISTS createTableName(time VARCHAR(40),title VARCHAR(100),text VARCHAR(40),clicks VARCHAR(10))DB_createself.connectDB()cursor_createDB_create.cursor()cursor_create.execute(createTableSql)DB_create.close()print creat tablecreateTableNamesuccessfullyreturncreateTableName#数据插入表中definserttable(self,insertTable,insertTime,insertTitle,insertText,insertClicks):insertContentSqlINSERT INTOinsertTable(time,title,text,clicks)VALUES(%s,%s,%s,%s)#insertContentSqlINSERT INTO insertTable(time,title,text,clicks)VALUES(insertTime , insertTitle , insertText , insertClicks)DB_insertself.connectDB()cursor_insertDB_insert.cursor()cursor_insert.execute(insertContentSql,(insertTime,insertTitle,insertText,insertClicks))DB_insert.commit()DB_insert.close()print inert contents toinsertTablesuccessfullyurlhttp://baoliao.hb.qq.com/api/report/NewIndexReportsList/cityid/18/num/20/pageno/1?callbackjQuery183019859437816181613_1440723895018_1440723895472#正则表达式获取js时间标题文本内容点击量(浏览次数)reg_jasonr.*?jQuery.*?\((.*)\)reg_timer.*?create_time:(.*?)reg_titler.*?title:(.*?).*?reg_textr.*?content:(.*?).*?reg_clicksr.*?counter_clicks:(.*?)#实例化crawl()对象crawlcrawl1()htmlcrawl.getHtml(url)html_jasonre.findall(reg_jason, html, re.S)html_needjson.loads(html_jason[0])printlen(html_need)print len(html_need[data][list])tablecrawl.creatTable(yh1)for i in range(len(html_need[data][list])):creatTimehtml_need[data][list][i][create_time]titlehtml_need[data][list][i][title]contenthtml_need[data][list][i][content]clickshtml_need[data][list][i][counter_clicks]crawl.inserttable(table,creatTime,title,content,clicks)
http://www.zqtcl.cn/news/486933/

相关文章:

  • 美食网站建设项目预算域名解析站长工具
  • 网站如何备案工信局学网站开发首先学哪些基础
  • 什么网站利于优化河北省建设局网站材料备案
  • 自学装修设计从哪里入手沈阳百度seo
  • 做jsp网站用哪些软件下载如何利用网站赚钱
  • 注册网站域名需要什么湘潭公司做网站
  • 一个网站如何优化企业资质查询平台
  • 模板网站为什么做不了优化山西网络网站建设销售公司
  • 建设什么网站可以赚钱设计本网站是用什么做的
  • 荆州市网站建设策划师
  • 苏州中国建设银行招聘信息网站中国企业登记网
  • 网站服务器的重要性新闻软文范例大全
  • 茶叶网站建设一般的风格加大志愿服务网站建设
  • 湖州医院网站建设方案网页游戏知乎
  • 以网站建设为开题报告临海门户网站住房和城乡建设规划局
  • 河南省大型项目建设办公室网站wordpress置顶功能
  • 奉化网站建设三合一网站建设多少钱
  • wordpress文章页怎么调用网站图片wordpress菜单锚点定位
  • 网站建设运营合作合同网站建设英文合同
  • wordpress chrome插件开发图片式网站利于做优化吗
  • 如何做好品牌网站建设策划app要有网站做基础
  • 横沥网站建设公司wordpress运行php
  • 南皮网站建设价格网络推广这个工作好做吗
  • 长安大学门户网站是谁给做的网站排名logo怎么做
  • 襄樊做网站做网站做网站
  • 百度做网站续费费用网站开发的可行性
  • 电子商务网站建设效益分析如何才能做好品牌网站建设策划
  • 能打开各种网站的浏览器app文章目录wordpress
  • 网站注册页面html中国建设招标网网站
  • 云南网站设计海外直购网站建设方案书范文