シーメンススターズからのシャノン情報容量

写真科学者や技術者は、写真システムが被写体の微細な特徴を再現する能力を単一の数値で十分に表すことはできないと強調している。

ニュース:Imatest 23.1には、傾斜エッジパターンから情報容量を計算する新しい方法が搭載されています。この方法は、ホワイトペーパー「 Imatestによるカメラ情報容量の測定」で開発・発表されています。傾斜エッジ法は、シーメンススター法よりも高速かつ効率的ですが、デモザイキング、画像圧縮、彩度によるアーティファクトの測定には適していません。

Imatest 2020.1 (2020年3月) シャノン情報容量は、シーメンススターの画像から計算されるようになりました。

シーメンススター法は、 Electronic Imaging 2020カンファレンスで発表され、 Electronic Imaging の Web サイトからリンクされている論文「 シーメンススター画像からカメラのシャノン情報容量を測定する」に掲載されました。以下に説明するホワイトペーパーは、より読みやすい内容となっています。(Imatest のニュース記事「 シーメンススター画像でカメラのシャノン情報容量を測定する」も参照してください。)

 

改訂版2020年ホワイトペーパー「 シーメンススターズによるカメラ情報容量」では、情報理論を簡単に紹介し、シーメンススターカメラの情報容量測定について説明した後、結果(アーティファクトの影響を含む)を示しています。

2番目のホワイトペーパー(2023年)「 Imatestによる情報容量の測定」では、広く使用されている傾斜エッジから情報容量を測定する方法について説明しています。

  • 斜めエッジ法は、より高速で便利であり、画像の総情報容量を測定するのに適しています。ほとんどのアプリケーションで推奨されますが、
  • シーメンススター法は、画像処理によるアーティファクトの影響を観察するのに適している。
クロード・シャノン

挑戦こそ至福の時!電子通信チャネルには、そのような指標が存在します。それは、チャネルを通してエラーなく伝送できる情報の最大量を定量化するものです。この指標には、鮮明度(帯域幅)とノイズ(フィルムの粒子)が含まれます。そして、カメラ、あるいはあらゆるデジタル画像システムは、まさにそのようなチャネルなのです。

ベル研究所のクロード・シャノン*が1948年に初めて発表したこの指標は、電子通信産業の基礎となっている。これはシャノンチャネル容量、またはシャノン情報伝送容量Cと呼ばれ、一見すると単純な式で表される。(詳細はシャノン・ハートレーの定理に関するWikipediaのページを参照のこと。)   

 

W  はチャネル帯域幅であり、画像の鮮明度に対応します。  S  信号エネルギー(信号の二乗)  電圧(画像ではMTF 2に比例)、 Nはノイズエネルギー(RMSノイズ電圧の2乗)で、フィルム中の粒子に対応します。見た目は十分にシンプル( E = mc 2より少し複雑なだけ)ですが、適用するのは簡単ではありません。

クロード・シャノンは真の天才でした。『 クロード・シャノンと過ごした1万時間:天才の思考、仕事、そして生き方』という記事は素晴らしい読み物です。 ニューヨーカー誌やサイエンティフィック・アメリカン誌にも、彼に関する興味深い記事が掲載されています。特に、29分間のビデオ「クロード・シャノン ― 情報化時代の父」は私にとって非常に興味深いもので、これは私が以前の仕事で頻繁に訪れていたカリフォルニア大学サンディエゴ校(UCSD)記憶・記録研究センターが制作したものです。

本稿では、 シーメンススター画像から情報容量を算出する方法について説明します。この手法を用いることで、信号とノイズを同一箇所から算出することが可能になります。また、デモザイキング、クリッピング、データ圧縮によるアーティファクトにも敏感に反応するため、これまで画像業界で用いられてきたどの手法よりも優れた画像品質測定を実現します。  技術的な詳細は、緑色の(「専門家向け」)ボックスに記載されています。

シャノン情報容量の意味

(カメラ情報容量に関するホワイトペーパーには、情報の簡潔な定義が記載されています。)

電子通信チャネルにおける情報容量とは、チャネルをエラーなく通過できる情報の最大量、つまりチャネルの「良さ」の尺度です。実際の情報量は、コード、つまり情報がどのように表現されるかに依存します。しかし、符号化はデータ圧縮(画像がファイルに保存される方法)に不可欠ですが、デジタルカメラには関係ありません。重要なのは、次の仮説です。

仮説:知覚される画像品質(適切に調整された画像処理パイプラインを前提とする)およびマシンビジョンと人工知能(AI)システムの性能は、カメラの情報容量に比例する。情報容量は、MTF(鮮明度)、ノイズ、デモザイキング、クリッピング(存在する場合)、およびデータ圧縮から生じるアーティファクトの関数である。

これはあくまで仮説、つまり推測を表す専門的な数学用語であることを強調しておきます。私の経験や数々の測定結果とは一致していますが、(2020年2月現在)業界に受け入れられるには、(様々な画像を用いた)さらなる検証が必要です。Imatestを使えば情報容量を簡単に計算できるようになったので、情報容量についてより深く理解する機会が得られたと言えるでしょう。

先に述べたように、情報容量は帯域幅Wと信号対雑音比S/Nの両方の関数です。

シャノン容量を紹介するテキストでは、帯域幅Wはしばしば半値周波数と仮定され、これはMTF50と密接に関係しています。厳密に言えば、 W log 2 (1+ S / N )は白色雑音(フラットなスペクトルを持つ)と単純なローパスフィルタ(LPF)の場合にのみ正しいです。しかし、デジタルカメラはシャープネスの度合いが様々であり、強いシャープネスは、単純なLPF応答から大きく逸脱する大きなピークを持つ応答曲線をもたらす可能性があります。このため、シャノン・ハートレー方程式の積分形式を使用します。

論文「シーメンス・スターイメージを用いたカメラのシャノン情報容量の測定」で説明されているように、ピクセルの二次元性を考慮するため、この式を二重積分に変換し、次に極座標形式に変換し、最後に一次元に戻す必要があります。式は下の緑色の枠内に示されています。

シーメンススター法の優れた点は、信号電力S ( f )と雑音電力N ( f )が同じ場所(角度の範囲と半径の狭い範囲のセグメントで、 SとNが同じ画像処理を受ける)から計算されることです。

情報容量を測定する上で重要な課題の一つは、平均信号電力Sをどのように定義するかである。理想的には、広く用いられているテストチャートに基づいて定義すべきである。便宜上、チャートはスケール不変であるべきである(そのため、チャートの正確な倍率を測定する必要はない)。そして、既に述べたように、信号と雑音は同じ場所で測定されるべきである。

異なる観測者が同じ結果を得るには、チャートのデザインとコントラストを標準化する必要があります。そのため、ISO 12233:2014/2017、附属書 E で規定されているチャートと同様の正弦波状のシーメンス星図を推奨します。コントラストは、50:1 (規格で規定されている最小値。マットメディアで達成可能な最大値に近い値) にできるだけ近づける必要があります。コントラストが高すぎると、星像の線形化が難しくなる場合があります。コントラストが低い場合は許容されますが、結果とともに報告する必要があります。高解像度システムの場合はチャートのサイクル数を 144 にする必要がありますが、低解像度システムの場合は 72 サイクルで十分です。解析のために画像を中央に配置するために使用される中心マーカー (象限パターン) の直径は、星の直径の 1/20 にする必要があります。

画像の取得とフレーミング

均一でグレアのない光の下で、シーメンス星の適切な露出画像を撮影してください。複数のカメラでテストする場合、露出は概ね一定である必要があります。星内部の線形化画像の平均ピクセルレベルは、0.16~0.36の範囲内である必要があります。(最適値はまだ決定されていません。)

光学的な歪み(存在する場合)による測定誤差を最小限に抑えるため、星の中心は画像の中心付近に配置する必要があります。自動センタリングが正しく機能するためには、中央のマーケットの端がほぼ垂直と水平になるように画像を向きを調整する必要があります。

画像内の星のサイズは、最小半径r minに対応する最大空間周波数がナイキスト周波数f Nyqより大きくなり、可能であれば 1.3 f Nyqを超えないように設定する必要があります。これにより、チャネル容量の計算に十分な低周波数が利用可能になります。つまり、1/20 の内側マーカーを持つ 144 サイクルの星の直径は 1400 ~ 1750 ピクセル、72 サイクルの星の直径は 700 ~ 875 ピクセルである必要があります。高品質のインクジェット プリンターの場合、星の物理的な直径は少なくとも 9 インチ (できれば 12 インチ) (23 ~ 30 cm) である必要があります。

チャートの周囲には他の要素があっても構いませんが、適切な露出を確保するためには、平均的な背景はニュートラルグレー(反射率18%)に近い色である必要があります(必要に応じて露出補正を適用しても問題ありません)。右の図は、24メガピクセル(4000×6000ピクセル)のカメラで撮影した典型的な星像を示しています。

Starモジュールを実行します

ターゲットから「Star」を選択することで、インタラクティブモード(初心者におすすめ)または自動(バッチ)モードで複数のファイルをバッチ処理できます。

星図設定ウィンドウで、 「情報容量を計算する」チェックボックス(設定セクションの下部付近)がオンになっていることを確認してください。SNRIの設定については後ほど説明します。その他の設定が正しければ、「OK」を押してください。

星設定ウィンドウ

「OK」ボタンを押すと、画像が解析されます。Rechartsでは、複数の表示形式から選択できます。下の表は、情報容量測定でのみ使用可能な表示形式を示しています。

情報容量測定のための表示
メインディスプレイセカンダリディスプレイ説明
9. 情報処理能力、SNRI SNR(比率)平均セグメントおよび最大8つの個別セグメントにおける空間周波数の関数としての信号対雑音比(S/N比)
SNR(dB)平均セグメントなどの周波数に対するSNR(dB)の関数。
信号、ノイズ平均セグメントにおける周波数の関数としての信号、ノイズ、および(S+N)/N (dB)。
信号、10倍ノイズ平均セグメントにおける周波数の関数としての信号、10倍ノイズ、および(S+N)/N (dB)。低レベルのノイズを視覚化するのに役立ちます。
NEQ周波数の関数としての雑音等価量子
10. 差分画像(ノイズのみなど)ノイズのみ(入力ノイズなし)ノイズのみを表示(信号は除去済み)。これは驚くべき結果であり、信号が存在する状況下でノイズを測定し、可視化したのはおそらくこれが初めてだろう。
損失(入力-理想値)入力 - ロスレス(テストチャート画像)。減衰されたデータが表示されます。解釈が困難です。
入力画像入力画像(未加工)
ノイズのない画像S idealから導出された理想的な (ノイズのない) 入力画像 (MTF 損失あり)。
理想的な画像(MTF損失なし) MTF損失のない「理想的な」画像(元のテストチャートを表す)。
ノイズのみ(線形)ノイズのみを線形化処理したもの。通常、ガンマエンコード版よりも暗めです。
入力画像(線形)入力画像は線形化されています。通常、ガンマ補正されたバージョンよりも暗くなります。
11. 3Dサーフェスプロット角度(グラフ上)と空間周波数(サイクル/ピクセル)の関数として、信号の3Dサーフェスプロットを表示します。最大8サイクルまで表示されます(それ以上表示すると、表示が煩雑になり解釈が難しくなります)。画像は回転可能です。長方形(角度×周波数)の表示領域は、実際にはグラフ上では扇形になっていることに注意してください。信号とノイズの周波数に対する小さなプロットと結果の概要も表示されます。

結果

Rescharts の 3 つの表示項目は、情報容量の結果を表示するように特別に設計されています。9 . 情報容量、SNRI 、 10. 入力ノイズなし差分など、 11. 3D サーフェス プロットです。以下は、高品質の 24 メガピクセル マイクロ フォーサーズ カメラの生画像 (24 ビット sRGB プリセットを使用して dcraw で TIFF に変換、ガンマ ≅ 2.2) に対して Rescharts で Star を実行した結果です。

情報容量プロット

下のグラフは、ISO 400に設定した24メガピクセルのマイクロフォーサーズ規格のソニーA6000における信号、ノイズ、および(信号+ノイズ)/ノイズ(dB)を示しています。

信号、雑音、シャノン情報容量(3.21ビット/ピクセル)
高品質な24メガピクセルのマイクロフォーサーズカメラでISO 400で撮影したRAW画像(TIFF形式に変換済み)。

これは、同じ画像をカメラ内でJPEG処理した結果を示しています。曲線には、シャープ化処理特有の「隆起」が見られます。JPEG画像はシャープ化処理されているにもかかわらず、シャノン情報容量は元の画像よりも低いことに注意してください。

これは、高周波ノイズが信号とともに増幅されるためです。

信号、雑音、およびシャノン情報容量
(2.92ビット/ピクセル)
カメラ内のJPEG
画像から
高画質24メガピクセル
マイクロフォーサーズカメラ、ISO 400。

差分画像プロット(入力画像-ノイズなし画像など)

ノイズのみ(入力ノイズなしの差分)のプロットは、信号が存在する状態で測定されたノイズ(正弦波状の星形パターンを除去したもの)を測定および視覚化できる画像がこれまで入手できなかったため、特に興味深いものです。ISO 400 ではノイズが非常に低く、したがって見えにくいため、マイクロフォーサーズカメラの最大値である ISO 25600 でのノイズを、RAW からの TIFF 画像と JPEG 画像の両方について示します。右側の[画像をコピー]ボタンをクリックすると、画像がクリップボードにコピーされ、画像エディタ/ビューアまたは画像統計モジュールに貼り付けてさらに分析できます。

マイクロフォーサーズカメラ用のノイズレス画像、RAW/TIFF画像、ISO 25600。

右側の画像は、上の画像と同じ撮影条件でカメラ内で生成したJPEG画像です(ISO 25600)。ノイズリダクション処理が施されているため、RAW/TIFF画像とは大きく異なって見えます。

以下の画像は、同じカメラでISO 400で撮影したRAW/TIFF画像とカメラ内JPEG画像です。

カメラ内JPEG、ISO 25600
RAW/TIFF ISO 400
カメラ内JPEG、ISO 400

3Dサーフェスプロット

3D表面プロットを使用すると、画像の小さな部分を詳細に調べることができます。

上記で解析した高品質24メガピクセルマイクロフォーサーズカメラの3D表面プロット。

この表示を得るには、設定ウィンドウで「3Dサーフェスプロット計算」 (および「情報容量の計算」)を有効にする必要があります。これは、選択したチャンネルの信号を、角度と空間周波数(サイクル/ピクセル)の関数として表示します。空間周波数は半径に反比例します。このプロットは、元の画像の狭い扇形スライスを表しており、高空間周波数における角度の詳細が大幅に拡大されています。

空間周波数の関数としてのMTFとノイズの小さなグラフと、主要な結果(情報容量など)の概要が表示されます。

このグラフは、iPhone 10 でのテストに基づいて作成されました。iPhone 10 では、画像が低~中程度の空間周波数で飽和しているように見えましたが、画像を見るだけでは飽和の度合いを正確に評価することが困難でした。右側のグラフを見ると、飽和が非常に強く、これは何らかの局所的なトーンマッピングの結果であると考えられます。星形パターンや隣接する傾斜エッジの MTF 曲線では、この飽和は明らかではありません。iPhone には、RAW (DNG) と JPEG の両方の形式で画像をキャプチャできる Adobe ソフトウェアがインストールされていました。これが JPEG 処理に影響を与えたかどうかは不明です。

下の画像は、TIFF ファイル (同じ iPhone 10 の DNG 生画像から変換) の応答を示しています。応答は正弦波で、振幅の歪みは見られません。情報容量は、歪んだ JPEG 画像とほぼ同じです。JPEG 画像では、いくつかのことが起こっています。画像が飽和している場所ではランダム ノイズはゼロですが、次のように定義されるノイズは存在します。 (下記参照)は、振幅歪み(正弦関数からのずれ)によって増加します。

他の事例でも観察された、画像処理に対する情報容量の非感受性は、注目すべき結果である。これに対し、高度に処理されたJPEG画像では、MTF50とMTF50Pの値がはるかに高い。

iPhone 10 TIFF (生データ (DNG) から作成した) の 3D サーフェス プロット、
正面図。整然とした正弦波パターンを示している。

iPhone 10 JPEGからの3D表面プロット、
正面図、大幅な切り抜きが見られる
(予想される正弦波からのずれ)

iPhone 10 JPEGからの3D表面プロット、
回転(後方)図。応答特性の低下を示している。
緑色はオタク向けです。優れた方程式にワクワクしますか?大学の数学の授業に情熱を注ぎましたか?もしそうなら、あなたはきっと数学オタクです。誤解されがちですが、非常にエリートな集団の一員です。緑色のテキストはあなたのために書かれています。もしあなたが普通の人、あるいは数学が苦手な人なら、これらのセクションは読み飛ばしても構いません。見逃した内容に気づくことはないでしょう。

シーメンス社のスターイメージを用いたシャノン容量の計算

ほとんどの交換可能な画像(通常はsRGBやAdobe RGBなどのカラースペースでエンコードされている)のピクセルレベルは、ガンマエンコードされています。これらのファイルの場合、ピクセルレベル≅(センサーの照度) 1/ガンマとなります。ここで、ガンマ(通常は約2.2)は、そのカラースペースの意図された表示ガンマ(ディスプレイの明るさ=(ピクセルレベル)ガンマ)です。これらのファイルを解析するには、ピクセルレベルをガンマのべき乗にすることで線形化する必要があります。RAWファイルは通常、線形化する必要はありません(ガンマエンコードなしでデモザイク処理されている場合、つまりガンマ=1の場合)。

nサイクルのシーメンススターの画像は、 n r = 32 または 64 の半径方向セグメントとn s = 8 (推奨)、16、または 24 の角度セグメントに分割されます。各セグメントは、周期 (ラジアン単位の角度長) P = 2 π n total /n s を持ち、n k = n total / n s サイクルとk n個の信号点を含み、 各信号点は既知の角度位置φにあり、範囲は{0, P }です。

セグメント内の理想的な信号は次の形式であると仮定します。

aとbは、Wikipediaのフーリエ級数のページ、式1から導出されたフーリエ級数係数方程式を使用して計算されます。

ここで、 S ( φ )は当該セグメントにおける測定信号(実際には信号+ノイズ)である。[この式はISO 12233:2017規格には含まれていないが、付録F、ステップ5(「期待される周波数の正弦曲線を、二乗誤差を最小化することによって測定値にフィッティングする」)の意図を完全に満たしている。]

騒音は

半径r (ピクセル単位)を中心とするセグメントの周波数f (サイクル/ピクセル)はこの方程式の興味深い帰結として、ナイキスト周波数(0.5 C/P)を簡単に特定できることが挙げられます。 = 45.8ピクセル、合計n = 144サイクル。

センタリング誤差、光学歪み、その他の要因によりfが期待値とわずかに異なる場合、(ここでは説明しない)小さな調整が行われます。

信号電力はノイズパワーはここで、 σ 2は分散(標準偏差の二乗)です。信号 + ノイズ電力は[注:シャノンの「雑音が存在する場合の通信」の文脈から、 N ( f )は信号S理想( f )が存在する場合に測定される雑音であり、周波数fの狭帯域雑音ではないと仮定します。]

シャノン方程式を1次元からピクセルに変換する

シャノン容量の完全な一次元方程式は、シャノンの情報理論に関する2番目の論文[1]の式(32)で提示されました。検討対象のピクセルは2次元であるため、この方程式を直接使用することはできません。

[一次元;未使用]

この方程式は、ピクセル(ここでは)が面積の単位を持つため、2次元に変換する必要があります。( ピクセルは距離fやMTFのような線形測定値の単位を持ちます。)

ここで、f xとf yはそれぞれx 方向とy方向の周波数です。この積分を評価するために、 xとy を極座標rとθに変換します。

SとNはθに弱くしか依存しないため、この方程式を1次元で書き直すことができます。

非常にマニアックな話:シャノン容量の極限ケース。8ビットのピクセルがあると仮定します。これは256レベル(0~255)に相当します。レベル間の距離1を「ノイズ」と考えると、シャノン方程式のS/Nの部分はlog 2 (1+256 2 ) ≅ 16となります。情報が正しく伝送できる最大帯域幅W (ナイキスト周波数)は、ピクセルあたり0.5サイクルです。(ナイキスト周波数を超える信号エネルギーはすべてゴミ、いわば偽情報です。)したがって、 C = W log 2 (1+( S/N ) 2 ) = ピクセルあたり8ビットとなり、これが出発点です。時には、同じところをぐるぐる回るのも心地よいものです。

まとめ

  • シャノン情報容量Cは、電子通信チャネルの性能を測る指標として長年用いられてきた。これは、適切な符号を用いた場合に、データがエラーなく伝送できる最大速度を示すものである(シャノン容量に匹敵する符号が見つかるまでには、ほぼ半世紀を要した)。画像処理においては、符号化は問題にならない。
  • Cは通常、ピクセルあたりのビット数で測定されます。総容量は。
  • Cを計算する前に、チャネルを線形化する必要があります。つまり、 SとNの正しい値を取得するには、適切なガンマ補正 (信号 = ピクセル レベルのガンマ、ここでガンマ ≈ 2) を適用する必要があります。ガンマの値 (2 に近い値) は、グレースケール ステップ チャートを分析するImatestモジュール ( Stepchart 、 Colorcheck 、 Color/Tone FixedまたはInteractive 、 SFRplus 、 eSFR ISO)のいずれかを実行して決定します。
  • Cは、特にマシンビジョンや人工知能カメラのカメラ品質を評価するための指標として使用できると我々は仮説を立てています。(ただし、消費者向けカメラの外観に直接反映されるわけではありません。なぜなら、消費者向けカメラは潜在能力を最大限に発揮し、魅力的な画像を生成するために、綿密な調整が必要だからです。)Cは、特に最小限の処理を施したRAW画像から変換した画像を使用する場合、カメラを比較するための公平な基準となります。
  • Imatestは、デジタル画像のY(輝度)チャネルのシャノン容量Cを計算します。これは、人間の目の感度を近似したものです。また、個々のR、G、BチャネルのC、およびCbとCrの色度チャネル( YCbCrから算出)のCも計算します。
  • シャノン容量は、計算や解釈が困難であったため、これまで写真画像の特性評価には用いられてこなかった。しかし現在では容易に計算できるようになり、写真画像の品質との関係性について研究が進められている。
  • 私たちは、 C言語とマシンビジョン/AIシステムの性能(精度、速度、消費電力)との相関関係を検証できる企業や学術機関との協業を期待しています。

画像全体の情報容量

これまで述べてきた情報容量は、通常画像の中心付近に位置する単一の星に関するものです。

ピクセルの情報容量を求めた後の次のステップは、カメラの総容量C totalを求めることです。残念ながら、レンズのシャープネス( MTF応答)は不均一で、通常は画像の中心からの距離とともに低下するため、 Cにメガピクセル数を掛けても確実に求めることはできません。画像の総情報容量を求めるには、2 つの方法があります。

  1. ISO 2014/2017規格に示されているグリッドと同様の、シーメンス社製の星図グリッドを使用します。ただし、Imatestは星のグリッドを自動的に検出しないため、この方法は不便です。また、光学的な歪みが大きい場合は、この方法はうまく機能しません。


  2. 複数の傾斜エッジを持つチャートを使用してください。できれば、関心領域(ROI)の自動検出機能を備えたImatestチャートのいずれかを使用してください。eSFR ISO 、 SFRplus 、またはCheckerboardが推奨されますが、傾斜エッジモジュールであればどれでも使用できます。これには2枚目の画像の撮影が必要です。

斜めエッジ法— 「 Imatest による情報容量の測定」で説明されている新しい (2023 年) 方法を推奨します。

情報容量ノイズ計算設定、
Rescharts設定ウィンドウの一部を切り取った画像
情報容量ノイズ計算設定、
「その他の設定」ウィンドウの左側から

完全なウィンドウと詳しい手順は、 SFRplus 、 eSFR ISO 、 Checkerboard 、 SFRreg 、またはSFRにあります。

結果は、エッジ/MTFプロット、2つの新しい3Dプロット、およびJSON出力に示されています。例はホワイトペーパーに掲載されています。

「3D & 等高線プロット」と「エッジ情報キャップ C_Max」を選択します。これにより、 C max 、 C max_slant_mean 、 C max_slant_totalの平均値と合計値が表示されます。次に、

ここで、 C max_slant_total = mean( C max_slant ) × megapixels です。

斜めのエッジからC合計を導出する従来の方法は非推奨となりました。

参考文献

  1. C.E. シャノン、 「雑音下における通信」、 Proc. IRE 、第37巻、第1号、10-21ページ、1949年1月、 doi: 10.1109/ jrproc.1949.232969。↩