【Linux工具篇】文本分析工具awk

时间 2019-12-04

原文原文链接

简介

awk是一个强大的文本分析工具，相对于grep的查找，sed的编辑，awk在其对数据分析并生成报告时，显得尤其强大。简单来讲awk就是把文件逐行的读入，以空格为默认分隔符将每行切片，切开的部分再进行各类分析处理。php

awk有3个不一样版本: awk、nawk和gawk，未做特别说明，通常指gawk，gawk 是 AWK 的 GNU 版本。html

awk其名称得自于它的创始人 Alfred Aho 、Peter Weinberger 和 Brian Kernighan 姓氏的首个字母。实际上 AWK 的确拥有本身的语言： AWK 程序设计语言，三位建立者已将它正式定义为“样式扫描和处理语言”。它容许您建立简短的程序，这些程序读取输入文件、为数据排序、处理数据、对输入执行计算以及生成报表，还有无数其余的功能。正则表达式

使用方法

awk '{pattern + action}' {filenames}

尽管操做可能会很复杂，但语法老是这样，其中 pattern 表示 AWK 在数据中查找的内容，而 action 是在找到匹配内容时所执行的一系列命令。花括号（{}）不须要在程序中始终出现，但它们用于根据特定的模式对一系列指令进行分组。 pattern就是要表示的正则表达式，用斜杠括起来。shell

awk语言的最基本功能是在文件或者字符串中基于指定规则浏览和抽取信息，awk抽取信息后，才能进行其余文本操做。完整的awk脚本一般用来格式化文本文件中的信息。express

一般，awk是以文件的一行为处理单位的。awk每接收文件的一行，而后执行相应的命令，来处理文本。编程

调用awk的方式

1.命令行方式api

awk [-F  field-separator]  'commands'  input-file(s)

其中，commands 是真正awk命令，[-F域分隔符]是可选的。 input-file(s) 是待处理的文件。
在awk中，文件的每一行中，由域分隔符分开的每一项称为一个域。一般，在不指名-F域分隔符的状况下，默认的域分隔符是空格。数组

2.shell脚本方式安全

将全部的awk命令插入一个文件，并使awk程序可执行，而后awk命令解释器做为脚本的首行，一遍经过键入脚本名称来调用。
至关于shell脚本首行的：#!/bin/sh
能够换成：#!/bin/awkbash

3.将全部的awk命令插入一个单独文件，而后调用：

awk -f awk-script-file input-file(s)

其中，-f选项加载awk-script-file中的awk脚本，input-file(s)跟上面的是同样的。

入门实例

假设last -n 5的输出以下

[root@www ~]# last -n 5 # 仅取出前五行
root     pts/1   192.168.1.100  Tue Feb 10 11:21   still logged in
root     pts/1   192.168.1.100  Tue Feb 10 00:46 - 02:28  (01:41)
root     pts/1   192.168.1.100  Mon Feb  9 11:41 - 18:30  (06:48)
dmtsai   pts/1   192.168.1.100  Mon Feb  9 11:41 - 11:41  (00:00)
root     tty1                   Fri Sep  5 14:09 - 14:10  (00:01)

若是只是显示最近登陆的5个账号

#last -n 5 | awk  '{print $1}'
root
root
root
dmtsai
root

awk工做流程是这样的：读入有'n'换行符分割的一条记录，而后将记录按指定的域分隔符划分域，填充域，&dollar;0则表示全部域,&dollar;1表示第一个域,&dollar;n表示第n个域。默认域分隔符是"空白键" 或 "[tab]键",因此&dollar;1表示登陆用户，&dollar;3表示登陆用户ip,以此类推。

若是只是显示/etc/passwd的帐户

#cat /etc/passwd |awk  -F ':' '{print $1}'  
root
daemon
bin
sys

若是只是显示/etc/passwd的帐户和帐户对应的shell,而帐户与shell之间以tab键分割

#cat /etc/passwd |awk  -F ':'  '{print $1"\t"$7}'
root    /bin/bash
daemon  /bin/sh
bin     /bin/sh
sys     /bin/sh

若是只是显示/etc/passwd的帐户和帐户对应的shell,而帐户与shell之间以逗号分割,并且在全部行添加列名name,shell,在最后一行添加"blue,/bin/nosh"。

cat /etc/passwd |awk  -F ':'  'BEGIN {print "name,shell"}  {print $1","$7} END {print "blue,/bin/nosh"}'
name,shell
root,/bin/bash
daemon,/bin/sh
bin,/bin/sh
sys,/bin/sh
....
blue,/bin/nosh

awk工做流程是这样的：先执行BEGING，而后读取文件，读入有/n换行符分割的一条记录，而后将记录按指定的域分隔符划分域，填充域，&dollar;0则表示全部域,&dollar;1表示第一个域,&dollar;n表示第n个域,随后开始执行模式所对应的动做action。接着开始读入第二条记录······直到全部的记录都读完，最后执行END操做。

搜索/etc/passwd有root关键字的全部行

#awk -F: '/root/' /etc/passwd
root:x:0:0:root:/root:/bin/bash

这种是pattern的使用示例，匹配了pattern(这里是root)的行才会执行action(没有指定action，默认输出每行的内容)。
搜索支持正则，例如找root开头的:awk -F: '/^root/' /etc/passwd

搜索/etc/passwd有root关键字的全部行，并显示对应的shell

# awk -F: '/root/{print $7}' /etc/passwd             
/bin/bash

这里指定了action{print &dollar;7}

awk 'length($0)>80 {print NR}' myfile  # 该命令行将显示文本myfile中全部超过80个字符的行号，在这里，用$0表示整个记录（行），同时，内置变量NR不使用标志符'$'。


# 假设要对UNIX中的用户进行安全性检查，方法是考察/etc下的passwd文件，检查其中的passwd字段（第二字段）是否为"*"，如不为"*"，则表示该用户没有设置密码，显示出这些用户名（第一字段）。咱们能够用以下语句实现：
awk -F: '$2=="" {printf("%s no password!",$1)' /etc/passwd

内置变量

awk有许多内置变量用来设置环境信息，这些变量能够被改变，下面给出了最经常使用的一些变量。

ARGC               命令行参数个数
ARGV               命令行参数排列
ENVIRON            支持队列中系统环境变量的使用
FILENAME           awk浏览的文件名
FNR                浏览文件的记录数
FS                 设置输入域分隔符，等价于命令行 -F选项
NF                 浏览记录的域的个数（列数）
NR                 已读的记录数（行数）
OFS                输出域分隔符
ORS                输出记录分隔符
RS                 控制记录分隔符

此外,&dollar;0变量是指整条记录。&dollar;1表示当前行的第一个域,&dollar;2表示当前行的第二个域,......以此类推。

awk '/api\.php/{print}' log_file #在缺省格式下模式是$0,即打印出全条

awk '/api\.php/' log_file # 甚至还能够忽略action部分,默认是print打印

统计/etc/passwd:文件名，每行的行号，每行的列数，对应的完整行内容:

#awk  -F ':'  '{print "filename:" FILENAME ",linenumber:" NR ",columns:" NF ",linecontent:"$0}' /etc/passwd
filename:/etc/passwd,linenumber:1,columns:7,linecontent:root:x:0:0:root:/root:/bin/bash
filename:/etc/passwd,linenumber:2,columns:7,linecontent:daemon:x:1:1:daemon:/usr/sbin:/bin/sh
filename:/etc/passwd,linenumber:3,columns:7,linecontent:bin:x:2:2:bin:/bin:/bin/sh
filename:/etc/passwd,linenumber:4,columns:7,linecontent:sys:x:3:3:sys:/dev:/bin/sh

使用printf替代print,可让代码更加简洁，易读

awk  -F ':'  '{printf("filename:%10s,linenumber:%s,columns:%s,linecontent:%s\n",FILENAME,NR,NF,$0)}' /etc/passwd

print和printf

awk中同时提供了print和printf两种打印输出的函数。

其中print函数的参数能够是变量、数值或者字符串。字符串必须用双引号引用，参数用逗号分隔。若是没有逗号，参数就串联在一块儿而没法区分。这里，逗号的做用与输出文件的分隔符的做用是同样的，只是后者是空格而已。

printf函数，其用法和c语言中printf基本类似,能够格式化字符串,输出复杂时，printf更加好用，代码更易懂。

head -10 log_file | awk '{printf "%03d %s\n",NR,$1}' 
# "%03d %s\n" 是格式,其中NR替换%03成为前导0的三位数字,$1替换%s成为字符串

001 220.181.108.180
002 220.181.108.180
003 220.181.108.150
004 123.125.71.45
005 220.181.108.142
006 220.181.108.162
007 151.80.31.110
008 220.181.108.82
009 220.181.108.185
010 151.80.31.112

awk编程

变量和赋值

除了awk的内置变量，awk还能够自定义变量。
下面统计/etc/passwd的帐户人数

awk '{count++;print $0;} END{print "user count is ", count}' /etc/passwd
root:x:0:0:root:/root:/bin/bash
......
user count is  40

count是自定义变量。以前的action{}里都是只有一个print,其实print只是一个语句，而action{}能够有多个语句，以;号隔开。

这里没有初始化count，虽然默认是0，可是稳当的作法仍是初始化为0:

awk 'BEGIN {count=0;print "[start]user count is ", count} {count=count+1;print $0;} END{print "[end]user count is ", count}' /etc/passwd
[start]user count is  0
root:x:0:0:root:/root:/bin/bash
...
[end]user count is  40

统计某个文件夹下的文件占用的字节数

ls -l |awk 'BEGIN {size=0;} {size=size+$5;} END{print "[end]size is ", size}'
[end]size is  8657198

# 以兆来显示
ls -l |awk 'BEGIN {size=0;} {size=size+$5;} END{print "[end]size is ", size/1024/1024,"M"}' 
[end]size is  8.25889 M

BEGIN和END

在awk中两个特别的表达式，BEGIN和END，这二者均可用于pattern中（参考前面的awk语法），提供BEGIN和END的做用是给程序赋予初始状态和在程序结束以后执行一些扫尾的工做。任何在BEGIN以后列出的操做（在{}内）将在awk开始扫描输入以前执行，而END以后列出的操做将在扫描彻底部的输入以后执行。所以，一般使用BEGIN来显示变量和预置（初始化）变量，使用END来输出最终结果。

awk 
>'BEGIN { FS=":";print "统计销售金额";total=0} 
>{print $3;total=total+$3;} 
>END {printf "销售金额总计：%.2f",total}'  
# 注：>是shell提供的第二提示符，如要在shell程序awk语句和awk语言中换行，则需在行尾加反斜杠
# 在这里，BEGIN预置了内部变量FS（字段分隔符）和自定义变量total,同时在扫描以前显示出输出行头。而END则在扫描完成后打印出总合计。

条件语句

if (expression) {
    statement;
    statement;
    ... ...
}

if (expression) {
    statement;
} else {
    statement2;
}

if (expression) {
    statement1;
} else if (expression1) {
    statement2;
} else {
    statement3;
}

统计某个文件夹下的文件占用的字节数,过滤4096大小的文件(通常都是文件夹):

ls -l |awk 'BEGIN {size=0;print "[start]size is ", size} {if($5!=4096){size=size+$5;}} END{print "[end]size is ", size/1024/1024,"M"}' 
[end]size is  8.22339 M

循环语句

awk中的循环语句一样借鉴于C语言，支持while、do/while、for、break、continue，这些关键字的语义和C语言中的语义彻底相同。

awk -F ':' 'BEGIN {count=0;} {name[count] = $1;count++;}; END{for (i = 0; i < NR; i++) print i, name[i]}' /etc/passwd
0 root
1 daemon
2 bin
3 sys
4 sync
5 games
......

先把用户名放在name的这个数组里面,执行完awk的隐式迭代后,最后的END部分经过for循环输出;

更多请参考: http://www.gnu.org/software/g...