爬虫获取一条新闻内容 2018-11-03

import pymysql

import requests as re

from bs4 import BeautifulSoup

try:

    url="http://www.cuc.edu.cn/zcyw/11569.html"

    r=re.get(url)

    soup = BeautifulSoup(r.text,'html.parser')

    title=soup.find_all('h1')

    newsfrom=soup.find_all('sapn')

    newsdate=soup.find_all('sapn')

    viewcount=soup.find_all('span',attrs={'id':'hits'})

    newscontent=soup.find_all('article',attrs={'class','con-area'})

    ntitle=title[0].get_text()

    nfrom=newsfrom[0].get_text()[27:30]

    ndate=newsdate[0].get_text()[67:77]

    ncount=int(viewcount[0].get_text())

    ncontent=newscontent[0].get_text()

    saverec(url,ntitle,nfrom,ndate,ncount,ncontent)   

except:

    print("error")

def getUrl():

    pass

def saverec(url,ntitle,nfrom,ndate,ncount,ncontent):   

    # pymysql.connect(数据库url,用户名,密码,数据库名 )

    db = pymysql.connect("localhost", "root", "2017", "engword", charset = 'utf8')

    cursor = db.cursor()

    try:

        cursor.execute("INSERT INTO cucnews(newsurl,title,newsfrom,newsdate,contents,newscount) VALUES(%s,%s,%s,%s,%s,%s)",(url, ntitle,nfrom,ndate,ncontent,ncount))

        db.commit()

    except:

        print(db.error())

        db.rollback()

    db.close()

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

  • ¥开启¥ 【iAPP实现进入界面执行逐一显】 〖2017-08-25 15:22:14〗 《//首先开一个线程,因...
    小菜c阅读 7,489评论 0 17
  • 大家好,希望各位能怀着正直、严谨、专业的心态观看这篇文章。ヾ(๑╹◡╹)ノ" 接下来我们尝试用 Python 抓取...
    宇哥聊AI阅读 1,515评论 0 4
  • 回家过年 邢松 年复一年连年过,过了一年又一年。 过年,即过春节,它是中华民族的传统节日,每逢过年,无论你身在何方...
    闲情雅趣阅读 524评论 1 3
  • 我叫斯诺,我是一只猫,你认识我的时候,我就叫这个名字,不过在很久很久之前,我还有另外一个名字,那个时候,一切都那么...
    栀子茗香阅读 526评论 6 6
  • 前几日,与蒋嘉宝先生约定了会面时间,商谈关于文化推广事宜。初次印象,其人沉浸于传统文化,活得纯粹而又自得其乐。临别...
    稚吟秋声阅读 384评论 0 3

友情链接更多精彩内容