awk

awk是一个强大的文本分析工具,简单地说,它是把文件逐行读入,以空格为默认分割符将每行切片,切开的部分再进行分析、处理。

使用方法

awk 'pattern + {action}'  filenames

案例说明:

xxx@ubuntu:~$ last -n 5
xxx   pts/9        192.168.58.1     Sat Sep  8 19:06   still logged in
xxx   pts/9        192.168.58.1     Sat Sep  8 06:47 - 18:11  (11:24)
xxx   pts/10       192.168.58.1     Fri Sep  7 20:24 - 21:21  (00:56)
xxx   pts/9        192.168.58.1     Fri Sep  7 19:26 - 21:21  (01:55)
xxx   pts/9        192.168.58.1     Fri Sep  7 06:45 - 18:56  (12:11)

wtmp begins Mon Sep  3 17:27:36 2018

xxx@ubuntu:~$ last -n 5 |awk '{print $1}'
xxx
xxx
xxx
xxx
xxx

wtmp

  awk会读取有'\n'换行符分割的一条记录,然后将记录按指定的域分隔符划分域,0表示所有的域,1表示第一个域,$n表示第n个域。

cat /etc/passwd |awk  -F ':'  'BEGIN {print "name,shell"}  {print $1","$7} END {print "blue,/bin/nosh"}'
name,shell
root,/bin/bash
daemon,/bin/sh
bin,/bin/sh
sys,/bin/sh
....
blue,/bin/nosh

 如果有BEGIN,就会先执行BEGIN,然后读取文件,读入有\n换行分割符的一条记录,对每条记录执行action,直到所有的记录都读完,最后执行end操作。

awk -F: '/root/' /etc/passwd // 搜索含有root关键字的行
root:x:0:0:root:/root:/bin/bash
awk -F: '/root/{print $7}' /etc/passwd
/bin/bash

awk内置变量

ARGC 命令行参数个数
ARGV 命令行参数排列
ENVIRON 支持队列中系统环境变量的使用
FILENAME awk浏览的文件名
FNR 浏览文件的记录数
FS 设置输入域分隔符,等价于命令行 -F选项
NF 浏览记录的域的个数
NR 已读的记录数
OFS 输出域分隔符
ORS 输出记录分隔符
RS 控制记录分隔符

xxx@ubuntu:~$ awk  -F ':'  '{print "filename:" FILENAME ",linenumber:" NR ",columns:" NF ",linecontent:"$0}' /etc/passwd
filename:/etc/passwd,linenumber:1,columns:7,linecontent:root:x:0:0:root:/root:/bin/bash
filename:/etc/passwd,linenumber:2,columns:7,linecontent:daemon:x:1:1:daemon:/usr/sbin:/usr/sbin/nologin
filename:/etc/passwd,linenumber:3,columns:7,linecontent:bin:x:2:2:bin:/bin:/usr/sbin/nologin
filename:/etc/passwd,linenumber:4,columns:7,linecontent:sys:x:3:3:sys:/dev:/usr/sbin/nologin
filename:/etc/passwd,linenumber:5,columns:7,linecontent:sync:x:4:65534:sync:/bin:/bin/sync
filename:/etc/passwd,linenumber:6,columns:7,linecontent:games:x:5:60:games:/usr/games:/usr/sbin/nologin
filename:/etc/passwd,linenumber:7,columns:7,linecontent:man:x:6:12:man:/var/cache/man:/usr/sbin/nologin
filename:/etc/passwd,linenumber:8,columns:7,linecontent:lp:x:7:7:lp:/var/spool/lpd:/usr/sbin/nologin
filename:/etc/passwd,linenumber:9,columns:7,linecontent:mail:x:8:8:mail:/var/mail:/usr/sbin/nologin

可以使用printf代替print,让代码更加简洁
 awk  -F ':'  '{printf("filename:%10s,linenumber:%s,columns:%s,linecontent:%s\n",FILENAME,NR,NF,$0)}' /etc/passwd

awk除了内置变量,还可以自定义变量。

  • 统计/etc/passwd的账户人数
awk '{count++;print $0;} END{print "user count is ", count}' /etc/passwd
  • 统计某个文件夹下的文件占用的字节数
xxx@ubuntu:~$ ls -l | awk 'BEGIN {size=0;} {size=size+$5;}END{print "size is", size}'
size is 63307
xxx@ubuntu:~$ ls -l | awk 'BEGIN {size=0;} {size=size+$5;}END{print "size is", size/1024/1024 " M"} '
size is 0.0603743 M  // 不包括文件夹的子目录
  • awk 使用数组
awk -F: 'BEGIN{count=0;} {name[count]=$1; count++;} END { for (i=0;i<NR;i++) print i, name[i]}' /etc/passwd

几个小例子

  • 统计tcp连接状态
xxx-MacBook-Pro:~ xxx$ netstat -n | awk '/^tcp/{++test[$NF]} END {for (a in test) print a, test[a]}'
CLOSE_WAIT 3
TIME_WAIT 1
ESTABLISHED 28

  S[]定义了一个名叫S的数组,在awk中,数组下标通常从 1 开始,而不是 0。
  NF当前记录里域个数,默认以空格分隔,如上所示的记录,NF域个数等于6
  $NF表示一行的最后一个域的值,$NF也就是$6,表示第6个字段的值,也即SYN_RECV或TIME_WAIT等。
  S[$NF] 表示数组元素的值,如上所示的记录,就是S[TIME_WAIT]状态的连接数++S[$NF]表示把某个数加一,如上所示的记录,就是把S[TIME_WAIT]状态的连接数加1
  END for(key in S)遍历S[]数组 print key,”\t”,S[key],打印数组的键和值,中间用\t制表符分割,显示好一些。

  • 统计apache日志单ip访问请求数排名
awk '{++S[$1]} END {for(i in S) print i, S[i]}' access.log | sort -k2 -r
10.0.0.41 3
10.0.0.47 2
10.0.0.46 2
10.0.0.42 2
10.0.0.43 1

  • 查看linux系统上的所有用户
xxx@ubuntu:~$ awk 'BEGIN{
    FS=":"
    printf("%-10s%-20s\n", "UserName", "HomeDir")
    print "=============================="
}
{
    printf("%-10s%-20s\n", $1, $6)
}
END{
    print "=============================="
    printf("User(s):%d\n", NR)
    print "=============================="
}' /etc/passwd

也可以将上述脚本写入listUser.awk这个文件,然后在命令行中执行:

awk -f listUser.awk /etc/passwd

透过现象看本质

image.png

上图为awk的基本流程,awk分为三个部分:

  • BEGIN(必须大写),初始化模块,进行分隔符的定义,初始化一些变量等,它在数据处理部分之前执行,且只执行一次,BEGIN模块是可选的。
  • 数据处理模块。这一部分是awk脚本的核心部分,它是一对以pattern与大括号括起来的action组合而成,两者可能会出现以下组合:
    • pattern {action} :记录(每行为一个记录)匹配对应的模式,则执行大括号中的操作
    • pattern 记录匹配所有的模式,直接打印记录。
    • {action} 对每一条记录都执行大括号中的操作
  • 数据处理模块会循环读取待处理文件中的记录,读一条处理一条,处理完再读下一条。
  • END(必须大写),最后的收尾处理模块。它会在所有的数据处理完毕后执行,END模块同BEGIN一样只执行一次并且也是可选的。

小结

本文主要介绍了awk的基本用法和一些小的案例以及awk流程分析,awk是一种功能极其强大的文本分析工具,值得深入研究。

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 214,588评论 6 496
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 91,456评论 3 389
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 160,146评论 0 350
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 57,387评论 1 288
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 66,481评论 6 386
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 50,510评论 1 293
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 39,522评论 3 414
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 38,296评论 0 270
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,745评论 1 307
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 37,039评论 2 330
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,202评论 1 343
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 34,901评论 5 338
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 40,538评论 3 322
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,165评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,415评论 1 268
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 47,081评论 2 365
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,085评论 2 352

推荐阅读更多精彩内容

  • awk介绍awk变量printf命令:实现格式化输出操作符awk patternawk actionawk数组aw...
    哈喽别样阅读 1,562评论 0 4
  • 本章主要学习内容awk介绍 awk基本用法 awk变量 awk格式化 awk操作符 awk条件判断 a...
    楠人帮阅读 1,267评论 0 8
  • 转载 原文的排版和内容都更加友好,并且详细,我只是在这里贴出了一部分留作自己以后参考和学习,如希望更详细了解AWK...
    XKirk阅读 3,203评论 2 25
  • Linux指令中文说明传送入口 整理自Linux指令中文说明 文本和数据进行处理的编程语言awk 是一种编程语言,...
    释闲人阅读 2,118评论 1 6
  • awk:报告生成器,格式化文本输出 内容: awk介绍 awk基本用法 awk变量 awk格式化 awk操作符 a...
    BossHuang阅读 1,453评论 0 9