preg_match提取表内容

Question

嗨，我在使用cURL和preg match来获取表内容的旧项目中遇到错误。 这是循环的一部分。 因此最好使用preg_match来适应旧代码。 我在提取内容时遇到问题。 列为12，但无法提取。 请帮忙。

谢谢。

HTML：

 <table><tr>
//looping rows
<td align="center"><input type='checkbox' name="arr[]" value="17700002186"></td>
<input type='hidden' name="table_rg_17700002186" value="rg">
<input type='hidden' name="rg_id_17700002186" value="17700002186">
<input type='hidden' name="rg_uid_17700002186" value="18000174">
<input type='hidden' name="rg_date_17700002186" value="2014-08-22 12:11:37">
<td align="left">1 </td>
<td>ADMIN1 </td>
<td>2014-08-22 12:11:37</td>
<td> <a href="javascript:void(0);" onclick="window.open('http://www.testing.net/rg/popup/1/ADMIN1/1','','toolbar=1,status=1,location=1,scrollbars=1,resizable=1,width=1000,height=500,left='+(screen.availWidth/2-500)+',top='+(screen.availHeight/2-250)+'');"> Rgst </a></td>
<td>TESTING</td>
<td>BA</td>
<td>From : TESTING_<BR>
To: TEST1<BR>(873-021-0435,22-08-2014) </td>
<td align="right" style="padding-right:20px;">251,515</td>
<td align="right" style="padding-right:20px;"> 251515</td>
<td align="right" style="padding-right:20px;">0</td>
<td><textarea wrap="VIRTUAL" name="keter_17700002186" cols="10" row="2"></textarea></td>

// end of looped rows    
</tr>
//---------UPDATED HTML:-------------
<tr>
<td colspan="4" align=right>
<input type="submit" class="button" value="Accept" name="sbm"/></td>
<td colspan="4" align=right>
<input type="submit" class="button" value="Reject" name="sbm"/></td>
<td colspan="4">
<input type="submit" class="button" value="Delete" name="sbm"/>
</td>
</tr>
</tbody>
<tfoot>
<tr>
<td colspan="12">
<div style="float:right;"></div>
Total Record: <b>1</b>
</td>
</tr>
</tfoot>
 </table>
//---------UPDATED HTML:-------------

Preg_match：

preg_match('/\
.*\<td(.*)<\/td>
.*\<td(.*)<\/td>
.*\<td(.*)<\/td>
.*\<td(.*)<\/td>
.*\<td(.*)<\/td>
.*\<td(.*)<\/td>
.*\<td(.*)<\/td>
.*\<td(.*)<\/td>
.*\<td(.*)<\/td>
.*\<td(.*)<\/td>
.*\<td(.*)<\/td>
.*\<td(.*)<\/td>
/simU',$html,$matches);

var_dump($matches); //array{}

Answer 1

我建议为此使用DOMDocument ：

http://php.net/manual/zh/domdocument.loadhtml.php

例：

// ...
$dom = new DOMDocument;
$dom->loadHTML($html);
$cells = $dom->getElementsByTagName('td');
foreach ($cells as $cell) {
    echo $cell->nodeValue, PHP_EOL;
}
?>

Answer 2

删除正则表达式中的新行尝试

preg_match('/\.*\<td(.*)<\/td>.*\<td(.*)<\/td>.*\<td(.*)<\/td>.*\<td(.*)<\/td>.*\<td(.*)<\/td>.*\<td(.*)<\/td>.*\<td(.*)<\/td>.*\<td(.*)<\/td>.*\<td(.*)<\/td>.*\<td(.*)<\/td>.*\<td(.*)<\/td>.*\<td(.*)<\/td>/simU',$html,$matches);

var_dump($matches);

Answer 3

您可以将preg_split与array_slice结合使用：

$a_cells = array_slice(preg_split('/(?:<\/td>\s*|)<td[^>]*>/iu', $text), 1);

演示版

preg_match提取表内容

问题描述

3 个解决方案

解决方案1
2 2014-08-22 06:37:13

解决方案2
0 2014-08-22 06:39:51

解决方案3
0 已采纳 2014-08-22 06:53:32

preg_match提取表内容

问题描述

3 个解决方案

解决方案1 2 2014-08-22 06:37:13

解决方案2 0 2014-08-22 06:39:51

解决方案3 0 已采纳 2014-08-22 06:53:32

解决方案1
2 2014-08-22 06:37:13

解决方案2
0 2014-08-22 06:39:51

解决方案3
0 已采纳 2014-08-22 06:53:32