一个简单的github 500+赞的python项目分析

altify是近些日子在github上了热门页的python应用,它简洁而具有创意。让我们来学习一下。

Donald Trump wearing a suit and tie 图像描述效果

痛点

我们知道,在编写网页(html)时,对图片(img)标签的文本描述(alt)属性的填写总是让人觉得麻烦(实现更好的SEO),有没有什么办法解决这个烦恼呢?有没有可能让它不烦人,自动化完成呢?

解决

Altify 以两百行不到的python代码实现了对html文件中的图片的alt属性的自动生成。 主要是运用了微软提供的深度学习图像识别API来产生图片相应的描述性语言,然后利用该描述性语言自动填充待处理的html文件中的图片属性。整个步骤一个命令就可以完成,且描述效果很好

效果

分析

  1. 用BeautifulSoup分析要处理的html文件
  2. 找到所有的图片标签
  3. 使用uploads.im网站的API上传图片,得到图片的url,然后使用该url向微软的API请求,得到图片的描述性语言。(对于图片宽度小于200px的不予处理)
  4. 填写html中所有图片的alt属性
  5. 将编辑后的html文件保存在原html文件旁边

整个代码主要是三个函数

  • def apply(html_file, api_key)
    利用BeautifulSoup分析html文件,修改html中的图片标签的属性,将修改后的html保存
    apply 调用 upload 和 caption 函数
  • def upload(image_address)
    上传图片得到图片的url和宽度
  • def caption(image_src, api_key)
    请求微软的api获取描述性文本

主要使用库:

  • BeautifulSoup 爬虫常用的简便好使的html处理库。
  • requests httplib urllib 网络请求常用库。实际上只用requests就够了。
  • argparse 命令行参数解析库。

其原理简单,逻辑清晰,没有大难点。

启发

  • 把合适的工具组合起来用于合适的情景中就能产生很好的效果。
  • 利用现成的API和python简便的网络请求功能以及广泛的第三方库,可以实现很有用的功能。
  • Python简洁强大的特性自动化方面具有很大的优势

适用Py3 - 微软API访问修改

import json
import requests

api_url = 'http://api.projectoxford.ai/vision/v1.0/describe'
api_key = "d0a6afa1311e4baabd6666692762eaea"
image_src = "http://h.hiphotos.baidu.com/image/h%3D200/sign=9d91b09b6f63f624035d3e03b745eb32/b90e7bec54e736d140a0b7aa9f504fc2d46269e4.jpg" 
# 测试图片

headers = {
    # Request headers
    'Content-Type': 'application/json',
    'Ocp-Apim-Subscription-Key': api_key,
}

data = {
    # Request parameters
    'maxCandidates': '1',
    "Url": image_src,
}
data = json.dumps(data, separators=(',',':'))

r = requests.post(api_url, data = data, headers = headers)

captioned_data = r.json()['description']['captions'][0]["text"]
# 测试返回为 'a dog sitting in the grass' 

# 此外用py3的话,源码中的BeautifulSoup函数删掉第二个参数,并且去掉一些冗余的引用库

返回数据


其它

  • 源码中使用的Uploads.im 是一个简单快速提供图片上传服务的网站,功能类似国内的七牛云。
  • 获取一个免费的微软机器视觉服务的 API Key。使用微软账户登录该网址后就能获取到Key了。如下图,在Computer Vision栏里。

此外可以学习的地方

res = 0
# Use this loop to see if a file with the same name exits. If ti does, add a suffix.
while os.path.exists(os.path.dirname(html_file) + "/altify" + str(res) +".html"):
    res+=1
parsed_html = BeautifulSoup(html_data)
parsed_html.prettify()
# 将修改后的html美化后保存
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 215,539评论 6 497
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 91,911评论 3 391
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 161,337评论 0 351
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 57,723评论 1 290
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 66,795评论 6 388
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 50,762评论 1 294
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 39,742评论 3 416
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 38,508评论 0 271
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,954评论 1 308
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 37,247评论 2 331
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,404评论 1 345
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 35,104评论 5 340
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 40,736评论 3 324
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,352评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,557评论 1 268
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 47,371评论 2 368
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,292评论 2 352

推荐阅读更多精彩内容

  • Python 面向对象Python从设计之初就已经是一门面向对象的语言,正因为如此,在Python中创建一个类和对...
    顺毛阅读 4,213评论 4 16
  • Spring Cloud为开发人员提供了快速构建分布式系统中一些常见模式的工具(例如配置管理,服务发现,断路器,智...
    卡卡罗2017阅读 134,647评论 18 139
  • # Python 资源大全中文版 我想很多程序员应该记得 GitHub 上有一个 Awesome - XXX 系列...
    aimaile阅读 26,474评论 6 427
  • 横看成岭侧成峰,远近高低各不同。不识庐山真面目,只缘身在此山中。 说到庐山,苏轼的《题西林壁》和李白的《望庐山瀑布...
    陌小豆wh阅读 541评论 0 0
  • 总结下我一直以来想学好却未能学好的技能: 1. 日语 2. 英语 3. 游泳 反思 1. 虽然在日本已经待了2年半...
    小卡亲阅读 170评论 0 0