深刻理解PHP Opcode缓存原理

时间 2019-12-04

标签深刻理解 php opcode 缓存原理栏目 PHP 繁體版

原文原文链接

什么是opcode缓存？
当解释器完成对脚本代码的分析后，便将它们生成能够直接运行的中间代码，也称为操做码（Operate Code，opcode）。Opcode cache的目地是避免重复编译，减小CPU和内存开销。若是动态内容的性能瓶颈不在于CPU和内存，而在于I/O操做，好比数据库查询带来的磁盘I/O 开销，那么opcode cache的性能提高是很是有限的。可是既然opcode cache能带来CPU和内存开销的下降，这总归是好事。php

现代操做码缓存器（Optimizer+，APC2.0+，其余）使用共享内存进行存储，而且能够直接从中执行文件，而不用在执行前“反序列化”代码。这将带来显着的性能加速，一般下降了总体服务器的内存消耗，并且不多有缺点。html

为何要使用Opcode缓存？
这得从PHP代码的生命周期提及，请求PHP脚本时，会通过五个步骤，以下图所示：linux

Zend引擎必须从文件系统读取文件、扫描其词典和表达式、解析文件、建立要执行的计算机代码（称为Opcode），最后执行Opcode。每一次请求PHP脚本都会执行一遍以上步骤，若是PHP源代码没有变化，那么Opcode也不会变化，显然没有必要每次都重行生成Opcode，结合在Web中无所不在的缓存机制，咱们能够把Opcode缓存下来，之后直接访问缓存的Opcode岂不是更快，启用Opcode缓存以后的流程图以下所示：数据库

有那些PHP opcode缓存插件？
Optimizer+（Optimizer+于2013年3月中旬更名为Opcache，PHP 5.5集成Opcache，其余的会不会消失？）、eAccelerator、xcache、APC …express

PHP opcode原理：
Opcode是一种PHP脚本编译后的中间语言，就像Java的ByteCode,或者.NET的MSL，举个例子，好比你写下了以下的PHP代码：缓存

<?php
   echo "Hello World";
   $a =1+1;
   echo $a;?>

PHP执行这段代码会通过以下4个步骤(确切的来讲，应该是PHP的语言引擎Zend)服务器

1.Scanning(Lexing),将PHP代码转换为语言片断(Tokens)2.Parsing,将Tokens转换成简单而有意义的表达式3.Compilation,将表达式编译成Opocdes4.Execution,顺次执行Opcodes，每次一条，从而实现PHP脚本的功能。

题外话：如今有的Cache好比APC,可使得PHP缓存住Opcodes，这样，每次有请求来临的时候，就不须要重复执行前面3步，从而能大幅的提升PHP的执行速度。函数

那什么是Lexing? 学过编译原理的同窗都应该对编译原理中的词法分析步骤有所了解，Lex就是一个词法分析的依据表。 Zend/zend_language_scanner.c会根据Zend/zend_language_scanner.l(Lex文件),来输入的 PHP代码进行词法分析，从而获得一个一个的“词”，PHP4.2开始提供了一个函数叫token_get_all,这个函数就能够讲一段PHP代码 Scanning成Tokens；性能

若是用这个函数处理咱们开头提到的PHP代码，将会获得以下结果:优化

Array([0]=>Array([0]=>367[1]=>Array([0]=>316[1]=> echo
        )[2]=>Array([0]=>370[1]=>)[3]=>Array([0]=>315[1]=>"Hello World")[4]=>;[5]=>Array([0]=>370[1]=>)[6]=>=[7]=>Array([0]=>370[1]=>)[8]=>Array([0]=>305[1]=>1)[9]=>Array([0]=>370[1]=>)[10]=>+[11]=>Array([0]=>370[1]=>)[12]=>Array([0]=>305[1]=>1)[13]=>;[14]=>Array([0]=>370[1]=>)[15]=>Array([0]=>316[1]=> echo
        )[16]=>Array([0]=>370[1]=>)[17]=>;)

分析这个返回结果咱们能够发现，源码中的字符串，字符，空格，都会原样返回。每一个源代码中的字符，都会出如今相应的顺序处。而，其余的好比标签，操做符，语句，都会被转换成一个包含俩部分的Array: Token ID (也就是在Zend内部的改Token的对应码，好比,T_ECHO,T_STRING)，和源码中的原来的内容。
接下来，就是Parsing阶段了，Parsing首先会丢弃Tokens Array中的多于的空格，而后将剩余的Tokens转换成一个一个的简单的表达式

1.echo a constant string
2.add two numbers together
3.store the result of the prior expression to a variable
4.echo a variable

而后就改Compilation阶段了，它会把Tokens编译成一个个op_array, 每一个op_arrayd包含以下5个部分：

1.Opcode数字的标识，指明了每一个op_array的操做类型，好比add , echo
2.结果存放Opcode结果3.操做数1给Opcode的操做数4.操做数25.扩展值1个整形用来区别被重载的操做符

好比，咱们的PHP代码会被Parsing成:

* ZEND_ECHO 'Hello World'* ZEND_ADD ~011* ZEND_ASSIGN !0~0* ZEND_ECHO !0

你可能会问了，咱们的$a去那里了？

这个要介绍操做数了，每一个操做数都是由如下俩个部分组成：

a)op_type :为IS_CONST, IS_TMP_VAR, IS_VAR, IS_UNUSED, or IS_CV 
b)u,一个联合体，根据op_type的不一样，分别用不一样的类型保存了这个操做数的值(const)或者左值(var)

而对于var来讲，每一个var也不同

IS_TMP_VAR, 顾名思义，这个是一个临时变量，保存一些op_array的结果，以便接下来的op_array使用，这种的操做数的u保存着一个指向变量表的一个句柄（整数），这种操做数通常用~开头，好比~0,表示变量表的0号未知的临时变量

IS_VAR 这种就是咱们通常意义上的变量了,他们以$开头表示

IS_CV 表示ZE2.1/PHP5.1之后的编译器使用的一种cache机制，这种变量保存着被它引用的变量的地址，当一个变量第一次被引用的时候，就会被CV起来，之后对这个变量的引用就不须要再次去查找active符号表了，CV变量以！开头表示。

这么看来，咱们的$a被优化成!0了。

转自：http://blog.linuxeye.com/361.html