还在为文本数据处理犯愁吗

本文章转载于搜狗测试

服务端测试里面很重要的一项内容是性能测试。几乎每一个服务我们都要通过测试手段去评估它的性能指标:能支持多少用户同时访问、服务端响应时间、服务端资源占用等等。一般而言我们是通过性能测试的软件,比如LoadRunner,通过模拟多个客户端同时向服务端发送请求来进行测试的。而在构造这些请求时,通常会需要做一些文本处理的工作。

一个实际的场景:某天开发找到小编说需要对某个图片搜索的接口做压力测试。然后开发告诉我:“这有一个线上搜索请求的log数据,大概一百万条,100M左右,你在里面抽取个一两万条用作压测数据吧。” log数据的结构大概是这样:

我们需要做的是把第一列的部分数据抽取出来单独做成一个文件。

按说处理的方法很多,比如最容易想到的,Python写个脚本,读入文件,处理之后输出即可。但其实这并不是最好的解决方案。今天就和大家介绍一款服务端文本处理的强大工具——awk

一、什么是awk

AWK是一种优良的文本处理工具。它不仅是 Linux 中也是任何环境中现有的功能最强大的数据处理引擎之一。AWK 提供了极其强大的功能:可以进行样式装入、流控制、数学运算符、进程控制语句甚至于内置的变量和函数。它具备了一个完整的语言所应具有的几乎所有精美特性。

说白了awk就是一个强大的文本处理工具。究竟怎么个强大法呢?我们看看文章开头提到的问题。如果该问题用awk去处理的话应该是怎样的呢?

awk'{print $1 > "result.txt"}'searchIsHit_20170213.txt

是的,就只需要这一行代码即可搞定,应该是比写个小程序去处理文本简单多了。这行代码的作用是把searchIsHit_20170213.txt文件中的第一列输出到result.txt文件中。

二、awk基本用法

我们可以把awk的语法简单总结为:

awk'{pattern + action}'

# 或者这样

awk'pattern {action}'

其中 pattern 表示 AWK 在数据中查找的内容,而 action 是在找到匹配内容时所执行的一系列命令。

以下就列举一些小编在平时测试工作中会用到的常见用法。

1.截取文件中固定的行(列)

如果你需要截取文件中固定的列,那么就用一行代码即可:

awk'{print $n > "ResultFile"}'SourceFile

其中$n表示文件的第n列,从1开始。n=0表示该文件的所有列。

>是重定向输出符号,表示将内容输出到某个固定的文件中。

如果需要操作该文件的前XX行或者固定的某几行,该怎么做呢?awk提供了一个内置的参数:NR,表示已经读入的记录数(就是行数)。因此如果我们需要截取前10000行的内容,这样既可:

awk'NR<=10000 {print $1 > "result.txt"}'searchIsHit_20170213.txt

同样,我们截取第1000到2000行之间的数据时,可以这样搞:

awk'NR>1000&&NR<=2000 {print $1 > "result.txt"}'searchIsHit_20170213.txt

awk可以通过 -F 参数指定分割符。在上面的情况中,我们没有指定,默认是以空格作为分隔符。如果某个文件中的分隔符不是空格,比如“:”,这时候-F参数就派上用场了:

awk -F":"'{print $1 > "result.txt"}'searchIsHit_20170213.txt

2.进行匹配查找

实际的需求中,我们通常需要在log文件中筛选出包含某些关键字的行。这时候就需要用到匹配查找了。匹配查找中,~表示模式开始,/ /中间是待查找的模式。举个例子,在某个log文件中,需要找出所有包含”JudgingTime”字段的行,那么awk可以这样做:

awk'$0~/JudgingTime/ {print $0 > "result.txt"}'test.log

除此之外,awk比较强大的地方在于它支持正则表达式的匹配。

举个例子,在某个文件中需要筛选出第一列是字母的所有行,可以这样做:

awk'$1~/([a-zA-Z]+)/ {print $0 > "result.txt"}'test.log

只要把需要过滤的正则表达式写到模式里面即可。

3.awk内置属性和函数

awk内置了一些常用的属性和函数,便于我们去调用实现更强大的功能。一些常见的函数如下:

属性/函数含义

length长度

IGNORECASE忽略大小写

split(string,array)将指定的字符串切割成数组

substr(s,p)返回字符串s中从第p个字符开始的后缀部分

substr(s,p,n)返回字符串s中从第p个字符开始长度为n的后缀部分

match(a,b)返回b在a中出现的位置,如果不包含则返回0

tolower(s)/toupper(s)将字符串转为小写/大写

看几个例子:

i.匹配length长度小于某个值的所有行:

awk'length < 20 {print $0}'test.log

ii.忽略大小写匹配:

awk'{IGNORECASE=1} $0~/abc/ {print $0}'test.log

上述命令可以把包含abc(大小写均可)的行输出出来。

iii.截取子串

awk'length < 20 {print substr($0,3,2)}'test.log

如果log中某行长度小于20,上述命令可将该行从第三个字符开始长度为2的子串输出出来。

3.结语

awk是一个功能非常强大的文本处理工具。小编从自己做压力测试准备测试数据的角度出发,仅向大家说明了最简单最基础的知识,涵盖平时测试时会用到的一些方法。关于awk的高级用法,各位读者大神们可以自行研究。相信这肯定是一个可以提高工作效(逼)率(格)的工具。

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 203,547评论 6 477
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 85,399评论 2 381
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 150,428评论 0 337
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 54,599评论 1 274
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 63,612评论 5 365
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 48,577评论 1 281
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 37,941评论 3 395
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 36,603评论 0 258
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 40,852评论 1 297
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 35,605评论 2 321
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 37,693评论 1 329
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 33,375评论 4 318
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 38,955评论 3 307
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 29,936评论 0 19
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 31,172评论 1 259
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 43,970评论 2 349
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 42,414评论 2 342

推荐阅读更多精彩内容

  • 转载 原文的排版和内容都更加友好,并且详细,我只是在这里贴出了一部分留作自己以后参考和学习,如希望更详细了解AWK...
    XKirk阅读 3,185评论 2 25
  • 1、Nginx日志分析日志格式:'$remote_addr - $remote_user [$time_local...
    运维前线阅读 702评论 0 4
  • netstat -tnlp|egrep -i "$1"|awk {'print $7'}|awk -F'/' '{...
    JerichoYu阅读 993评论 0 0
  • 基础命令 主要的命令和快捷键 Linux系统命令由三部分组成:cmd + [options]+[operation...
    485b1aca799e阅读 1,085评论 0 0
  • awk:报告生成器,格式化文本输出 内容: awk介绍 awk基本用法 awk变量 awk格式化 awk操作符 a...
    BossHuang阅读 1,451评论 0 9