URL抽出

テキスト処理 > PCRE — 正規表現 (Perl 互換)

概要

 閲覧数:2246  投稿日:2011-01-29  更新日:2013-08-24  

・正規表現の最短マッチを利用して、URL抽出

・任意の文字列の中から、開始語と終了語を指定して、文字列を抜き出す
・○○.*?△△
・ここでの「.*?」の意味は、○○で始まり、△△で終わる文字列の最短一致


<例>
任意の文字列/hoge/piyo/puyo/pipipi.html任意の文字列

<やりたいこと>
/hoge/で始まり、.htmlで終わる文字列を抜き出したい。


<正規表現>
/hoge/.*?\.html

. ピリオド
改行を除く任意の一文字を表す

* アスタリスク
直前の文字列やメタ文字の「0回以上の繰り返し」を表す

? クエスチョン
⇒直前の文字列やメタ文字の「0回もしくは1回の出現」を表す。
⇒最短一致記号。
※使われる場所によって、意味が異なる。

「.*」、「.+」
限りなく連続した文字を表す

「*?」
「0回以上のくり返し(最短一致)」

「*」
「0回以上のくり返し(最長一致)」



コード

$pattern="|/hoge/.*?\.html|";

$str=<<<eof
任意の文字列/hoge/piyo/puyo/pipipi.html任意の文字列
任意の文字列/hoge/puko/pu.html任意の文字列
任意の文字列/hoge/pa/pa.html任意の文字列
eof;

preg_match_all($pattern,$str,$match);
print_r($match);



結果

Array
(
    [0] => Array
        (
            [0] => /hoge/piyo/puyo/pipipi.html
            [1] => /hoge/puko/pu.html
            [2] => /hoge/pa/pa.html
        )

)



タグ


preg_match_all 



郵便番号だけを許可



週間人気ページランキング / 9-26 → 10-2
順位 ページタイトル抜粋 アクセス数
1 PHPコード 23
2 sprintf | タグ毎エントリー一覧 3
3 8桁の生年月日数字を分解 | 文字列(テキスト処理) 2
3 変数名を動的にセットし使用 | 可変変数(変数) 2
4 「Fatal error」を発生させないuser定義count関数 | 配列(型) 1
4 特定のHTMLタグのみ表示を許可 | エスケープ処理 1
4 文字列の先頭に0があった場合に、取り除く | 文字列(テキスト処理) 1
4 現在WebページのURLパスを第2階層まで取得 | パス 1
4 配列内容を、foreachでテーブル表示 | テーブル 1
4 s | タグ毎エントリー一覧 1
4 平均値、分散、標準偏差、学力偏差値を求める | 統計 1
4 多次元配列で「二次元目の最大値 +1 」 を返す | 配列(型) 1
4 「対象文字列」に「指定文字列」が含まれていれば、「指定文字列」より後を返す | テキスト処理 1
4 変数のスコープ(変数) カテゴリー 1
4 対象文字列へ対して、一致したすべての文字列を置換する標準関数 / str_replace | 文字列(テキスト処理) 1
4 ネットワーク 関数 カテゴリー 1
4 配列のキーと値を反転した新しい配列を返す array_flip() | 配列(型) 1
4 $_SERVER['REQUEST_URI'] | タグ毎エントリー一覧 1
4 var_export内容をテキストファイル出力 | デバッグ 1
4 var_dump | タグ毎エントリー一覧 1
2026/10/3 5:05 更新