この研究の基本的な前提は、情報容量およびエッジや物体検出性能を測定するための関連指標は、イメージングシステムの性能を予測および最適化するための従来の指標(鮮明度やノイズ)よりも優れているという点である。
関連ページ 画像情報指標:情報容量などには、画像情報指標に関するドキュメント、ホワイトペーパー、ニュースなどへの重要なリンクが含まれています。 Electronic Imaging 2024に掲載された改訂版(2024年8月)論文「傾斜エッジからの画像情報メトリクス」には、画像情報メトリクスに関する最も包括的かつ最新の解説が掲載されています。また、この内容は、 「画像情報メトリクス」からリンクされている3つのホワイトペーパーでも、様々なレベルで詳細に解説されています。
「傾斜エッジからの画像情報メトリクス:手順」には、このページで説明されている計算を実行するための手順が記載されています。 傾斜エッジ法は、より高速で便利であり、画像の総情報容量を測定するのに適しているため、ほとんどの用途で推奨されますが、 シーメンススター法(2020)は、画像処理アーティファクト(デモザイキング、データ圧縮など)の影響を観察するのに適しています。 |
このページには、画像情報指標の計算式とアルゴリズムが記載されています。これには、Imatestで最も広く使用されているテスト画像である傾斜エッジ画像から情報容量Cを計算する方法、および信号とノイズを同じ位置から計算して画像品質をより正確に測定する方法が含まれます。これは、「傾斜エッジからの画像情報指標:手順」の計算に関する参考資料です。
付録1には、情報理論の簡単な紹介が掲載されています。
おすすめの読書2024年4月現在、画像情報指標を説明する文書が多数存在します。これはその中でも初期のものの1つです(手順ページの相互参照として役立ちます)。他のページへのリンクを追加することで正確性を維持しますが、詳細な内容は追加しません。 画像情報指標について学ぶには、Electronic Imaging 2024に掲載された改訂版(2024年8月)論文「斜めエッジからの画像情報指標」をお勧めします。この論文には、画像情報指標に関する最も包括的な解説が掲載されています。また、2つのホワイトペーパー(簡略版と詳細版)では、同様の内容を異なる詳細度で解説しています。
|

新しい測定方法の紹介
このページでは、 Imatestの情報容量関連の測定について説明します。これらの測定は、最近発見された傾斜エッジの特性を利用したもので、 ImatestがMTF測定に最も広く使用しているパターンです。新しい指標の多くは医療画像処理で使用されていますが、実施が困難だったため、あまり知られていません。ここでは、信号が存在する状況下でノイズを測定する2つの異なる方法を利用して、傾斜エッジからこれらの指標を簡単に測定する方法を説明します。
- エッジ分散計算は、空間に依存するノイズN ( x )を測定し、それを使用してカメラの情報容量を近似的に計算します。
- ノイズ画像計算では、周波数依存ノイズN ( f ) を測定し、それを使用して代替情報容量と、ノイズパワースペクトル (NPS) 、ノイズ等価量子 (NEQ) 、 SNRiなどのいくつかの追加の画像情報指標を計算します。
非常に異なる種類の画像処理を施した画像からでも、情報量を取得することができる。
- カメラのRAWファイルからTIFFまたはPNGファイルに変換された、最小限または均一に処理された画像。ここでいう「最小限の処理」とは、シャープネス処理やノイズリダクション処理を行わず、せいぜい単純なガンマカーブを適用する程度(複雑な階調応答曲線や局所的なトーンマッピングは適用しない)を意味します。カラーマトリックスを適用することも可能ですが(ノイズとSNRには影響しますが、MTFには影響しません)、これらの画像が利用可能な場合は、最も信頼性の高い情報容量測定値が得られます。
- カメラのJPEGファイルには、通常、バイラテラルフィルタ(エッジなどのコントラストの高い特徴付近の画像を鮮明にする一方で、それ以外の部分をぼかしてノイズを低減するフィルタ)が備わっており、画像が実際よりも多くの情報を含んでいるように見えます。これにより、従来のSNR測定(フラットパッチから算出)は改善されますが、実際には情報が失われます。Cの妥当な近似値を得ることはできますが、バイラテラルフィルタ処理された画像は、画像情報指標( SNRiなど)には使用すべきではありません。ここでは、バイラテラルフィルタ処理された画像を識別する方法を示します。
2000年からISO 12233規格の一部となっているMTFの計算における傾斜エッジ法の概要、
- 傾斜したエッジを持つ関心領域 (ROI) 内の各スキャンラインy l ( x )の中心を見つけます。
- 中心点に多項式曲線を当てはめる。
- 行の内容を、中心位置に基づいて4つのビンのいずれかに追加します。
- ビンを交互に配置することで、4倍オーバーサンプリングされた平均エッジが得られ、個々のスキャンラインよりもノイズが低くなります。
- MTF (変調伝達関数、通常は空間周波数応答( SFR )と同義)を計算するには、平均化されたエッジを微分して線幅広がり関数(LSF)を取得し、LSFをウィンドウ処理した後、フーリエ変換を行います。MTFは、ゼロ周波数で1(または100%)に正規化されたフーリエ変換の絶対値です。
騒音測定のための2つのステップ
傾斜エッジが存在する場合のノイズは、2つのステップで測定されます。まず、ROI内の各スキャンラインの二乗を合計することにより、空間的に依存するノイズパワーN ( x )が計算されます。ほとんどの場合、これによりN ( x )のピークの存在を利用して、非均一な画像処理(バイラテラルフィルタリングなど)が適用されたかどうかを判断でき、非均一な処理が行われた場合でも情報容量Cを近似的に計算できます。
第2のステップでは、ノイズ画像からノイズパワースペクトルNPS ( f )を計算します(詳細は後述)。これは、両側(非均一)フィルタリングされた画像には適用されません。ノイズを完全に特徴づけるものです。混乱を避けるため、この2つのステップについて以下に説明します。
ステップ 1 では、空間依存ノイズのエッジ分散計算N ( x )が最初に開発され、Electronic Imaging 2023 で発表されました。これにより、あらゆる種類の画像処理の情報容量Cの初期計算が可能になります。カメラ内 JPEG で一般的なバイラテラル (非均一) 処理は、 N ( x )のピークによって識別できます。
ステップ2のノイズ画像計算では、ノイズパワースペクトル(ウィーナースペクトル) NPS ( f )を測定し、 ∫N ( x ) dxを使用して正規化する必要があります。これによりノイズが完全に特徴付けられ、 NEQ ( f )、 SNRi 、エッジ位置標準偏差( σ )(1/エッジSNRi)などの画像情報指標の計算が可能になります。これは、最小限かつ均一に処理された画像にのみ有効です。
情報容量の報告には、現在、ステップ2の結果を推奨しています。これは、正しいノイズスペクトルNPS ( f )を使用しているため、より正確ですが、均一に処理された画像または最小限の処理しか施されていない画像にのみ有効です。NPSがフラット(白色)であると仮定したステップ1の結果は、バイラテラルフィルタ処理された画像(ほとんどの民生用カメラのJPEG画像)の性能を(完全ではないものの)近似的に示すのに役立ちます。
A:エッジ分散ノイズの計算
要約:走査線の二乗を合計してエッジ分散を求め、それを用いて初期情報容量を計算する。
エッジ分散情報容量の計算については、ホワイトペーパー「 新しい傾斜エッジ画像品質測定:エッジ分散計算」および電子イメージング2023論文「傾斜エッジによるカメラ情報容量の測定」で詳しく説明されています。
計算は、通常4:1のコントラストチャートから作成された傾斜エッジの画像( 下図の元のROI )から始まります(2:1から10:1までのチャートコントラストも許容範囲です)。上記のビニング/加算に加えて、スキャンラインの二乗が加算されます。これにより、信号依存ノイズ電力N ( x )に相当するエッジの分散σs2 ( x )を計算できます。
シャノン・ハートレー方程式のノイズパワーN (x) = σ s 2 ( x )と電圧σ s ( x )は重要です。なぜなら、多くの画像(民生用カメラのほとんどの JPEG を含む)にはバイラテラルフィルタが使用されており、エッジなどのシャープな領域付近では画像をシャープにし(ノイズを増幅)、それ以外の領域ではぼかして(目に見えるノイズを低減)しているからです。これにより、システムの性能と情報容量にとって重要なエッジのノイズが隠されてしまいます。新しい技術では、エッジ付近の信号依存ノイズを可視化し、情報容量の計算に使用できるようにします。また、非常に便利です。
Nの選択は画像処理に依存する。大きく分けて2つの種類が特定されている。
- 均一に、または最小限の処理しか施されていない画像。多くの場合、双方向フィルタリングなしでRAWファイルからTIFFに変換されたTIFFファイル(RAW→TIFF)であり、シャープネス処理やノイズリダクションが全く施されていないか、あるいは均一に施されている。マシンビジョン/人工知能向けに設計されたカメラのほとんどは、このカテゴリに分類される。
ノイズはxの非常に粗い関数となる可能性があるため、 Nの値を安定させるには大きな領域サイズが必要です。ROI内のすべてのxの値について平均をとります。
ROI内のすべてのxの値について。 - 両方向フィルタリングされた画像には、一般消費者向けカメラで撮影されたJPEG画像のほとんどが含まれます。
バイラテラルフィルタは、エッジなどのコントラストの高い特徴付近の画像を鮮明にする一方で、それ以外の部分ではぼかし(ノイズを低減するため)ます。これにより、エッジ付近にノイズピークが発生します(下図左)。ぼかし処理によって信号対雑音比(SNR)は向上しますが、情報が失われます。そのため、エッジ付近のノイズはカメラの性能に大きな影響を与える可能性があり、 Nの計算において重要な重み付けをする必要があります。ノイズピークの存在は以前から知られていましたが、本手法が開発されるまでは容易に観測できませんでした。
情報容量C initを計算するために、ピーク時の電圧σの二乗を平滑化(長さPW 20/2 の矩形カーネルを使用)してギザギザを取り除きます。 これはやや恣意的な選択ではありますが、比較的安定した結果が得られます。この方法は均一に処理された画像にも適用できますが、結果の精度は低下します。
Imatestでは、ノイズNの計算方法を選択できます。Nは均一、 Nは両側性、またはピークの有無に応じて自動的に検出されます。

x軸は、4倍オーバーサンプリングされた信号の元のピクセル位置を示します。

シャノン・ハートレー方程式の信号電力Sピーク間振幅VPPの一様分布信号の平均信号振幅は— 上記のシャノン・ハートレー方程式を使用して情報容量を計算する際に使用する妥当な数値で、平均信号電力、 。
新たに発見されたビニングノイズを除去し、ノイズ電力計算を選択し、方形波であるエッジからの信号レベルを調整して「平均」信号をより代表するようにした後、数値をシャノン・ハートレー方程式(上記)に入力して情報容量を計算し、グラフのコントラストを示します。
帯域幅Wは常に 0.5 サイクル/ピクセル (ナイキスト周波数) です。ナイキスト周波数を超える信号は情報量に寄与しません。エイリアシング (モアレなどの偽の低周波信号で、真の画像に干渉する可能性がある) を引き起こすことで、情報量を減少させる可能性があります。周波数依存性はMTF ( f )から得られます。
S avg ( f ) 、 N 、およびWをシャノン・ハートレー方程式に入力して情報容量Cを取得します。
エッジ分散法の主な結果は以下のとおりです。
C 4EVは、4:1のコントラスト比の傾斜エッジを測定した直接的な結果です。これは、いくつかの仮定(信号がピーク間測定値全体に均一に分布していること、およびノイズパワースペクトル密度(NPD)が平坦であること)を用いて、シャノン・ハートレー方程式から計算されます。C 4 C nは、 n :1 のコントラスト比 (ISO 標準 4:1 を強く推奨) の C n の特殊なケースです。C nはチャートのコントラスト比と露出に敏感であるため、露出の関数としてパフォーマンスを測定するのに役立ちます。
C maxEV (付録2で導出)は、 C 4 (4:1コントラストチャートの場合)から始まるカメラの最大情報容量の、より安定した測定値です。また、少なくともリニアセンサーの場合、ノイズが信号電圧の既知の関数であるため、露出の影響を受けません。
エッジ分散法の主な結果を以下に示します。(この画像は最小限の処理しか施されていません。)

eSFR ISOイメージを最小限の処理でRAW画像から変換
B. ノイズ画像計算
概要:低ノイズの逆投影/デビニングされたROI画像を元の画像から差し引いてノイズ画像を取得し、それを使用してノイズパワースペクトル( NPS )やその他のいくつかの測定値を計算します。
このステップでノイズの特性を完全に把握できます。
| 測定 | 説明 |
| ノイズパワースペクトル、 NPS ( f ) | エッジ分散法では、NPSは暗黙のうちに一定(ホワイトノイズ)であると仮定されていたが、これは妥当な初期近似であった。 |
| 雑音等価量子、 NEQ ( f )およびNEQ情報( f) | 周波数依存の信号対雑音比(SNR)の測定値。 NEQ ( f)は医療画像品質の定量化に用いられてきたが、一般的な画像処理ではあまり知られていない。NEQ (f)は光子ショットノイズが支配的な場合にセンサーによって検出される量子数に相当する。 イメージセンサーに到達する量子密度が既知の場合、デジタル量子効率(DQE)の計算に適しています。NEQ情報( f)は以下から導出されます。 そのため、情報容量C NEQの計算に適しています。 |
| 情報処理能力 C 4NEQとC maxNEQ | これらはエッジ分散法によるC 4NEQおよびC maxNEQ (付録2 )に対応しますが、 NEQ情報( f)から導出されます。これらは近いですが、同一ではありません。 |
| 理想的な観測者の信号対雑音比、 SNRi | 物体検出のための指標。SkorkaとKane[ 9 ]によると、「理想的なオブザーバーは、2つの可能な結果を持つ仮説検定の統計的精度を最大化するベイズ的意思決定者である」。ここで紹介するSNRiは、通常コントラストの低い小さな物体(正方形または長方形)の検出可能性の指標である。 |
| エッジ位置σ (1/エッジSNRi) | オブジェクト(エッジ)の勾配に基づいた、エッジ位置の指標。 傾斜エッジからの画像情報指標で説明されています。 |
| マッチドフィルタ伝達関数 | 特定のタスク(物体検出またはエッジ検出)に対して最適なSNRを提供するフィルタの伝達関数。 傾斜エッジからの画像情報メトリックで説明されています。 |
| ノイズ自己相関 | ノイズ電圧スペクトルの逆フーリエ変換。センサーの電気的クロストークに関連する。 |
| これらの結果を取得および表示する手順は、 情報容量に関する説明ページ。 |
ノイズ画像計算は、ノイズ計算の2番目のステップです。これはノイズを完全に特徴付け、情報容量や関連する性能指標(画像情報メトリックと呼ぶ)を計算するために使用されます。
この計算では、ISO 12233 ビニング手順を反転させます。4 倍オーバーサンプリングされたエッジは、それぞれが元の画像から得られた平均化された (ノイズ低減された) 信号を含む 4 つのビンの内容をインターリーブすることによって作成されたことに注目し、ビニング アルゴリズムの逆を適用して、各スキャン ラインの内容を対応するインターリーブに設定します (逆ビニング... ROI 、 下記)。逆ビニングされた画像は元の画像のほぼノイズのない複製であるため、逆ビニングされた画像を元の画像から減算することでノイズ 画像を作成できます。この画像は、平均 (ゼロ) 値が中央の灰色になるように調整され、右下のノイズ 画像 ROIとして表示されます。
ノイズ画像は、元の画像から逆投影画像を差し引くことで作成でき、エッジ方向の不均一性を補正します。3つの画像を以下に示します。ノイズ画像(右下)は平均値が0で、表示用に明るさとコントラストが強調されています。3つの画像は線形です。表示用にガンマカーブが適用されています。
これらの画像により、医療画像システムでよく知られており、 Ian Cunningham と Rodney Shaw による優れたレビュー論文[ 4 ] で説明されているノイズパワースペクトルやノイズ等価量子など、いくつかの重要な画像品質パラメータを計算することができます。これらの測定値は、測定が困難であったため、医療画像以外の分野ではあまり知られていません。
雑音パワースペクトル(NPS)
( ノイズ(電圧)スペクトルの二乗)は、ノイズROI(関心領域)の2Dフーリエ変換を行い、初期2Dスペクトルが画像の中心でゼロ周波数であることを考慮して計算されます。 正規化されていない1DノイズパワースペクトルNPS U ( f )は、 2Dスペクトルをいくつかの環状領域(数はROIのサイズによって異なり、6~10が一般的)に分割し、各領域の平均ノイズパワーを取ることによって計算されます。この変換により、垂直MTFと水平MTFが近いという仮定の下で、(2次元ではなく)1次元で計算を実行できます。ノイズパワースペクトルは、正規化定数c Nで正規化する必要があります。 。
NPSとノイズ画像の分散の関係は、 CunninghamとShaw [ 4 ]の式(3)と(8)で与えられており、我々はこれを1次元に縮小し、積分範囲を{-∞,∞}から{0, f Nyq }に変更した。ここで、 f Nyq = ナイキスト周波数 = 0.5サイクル/ピクセルである。パーセバルの定理を適用すると仮定すると、
上記で説明した1次元フーリエ変換は、上記の式と整合するようにスケーリングする必要がある。
雑音等価量子(NEQ)
は医療画像処理ではよく知られた評価指標ですが、一般的な画像処理ではあまり知られていません。これは、Brian Keelan による 2016 年の論文 [ 5 ] で説明されています。基本的には、周波数に依存する信号対雑音比 (電力) です。単位は、光子ショットノイズが支配的な場合に測定された SNR を生成する量子数に相当します。
ここで平均線形信号は、 μは、 NEQをどのように解釈するかによって、2つの方法のいずれかで定義できます。
NEQをDQE (デジタル量子効率)の計算に使用する場合、 、 それから μは、元の画像における線形化された信号電圧の平均値であるべきです。DQEの測定には、各ピクセルに到達する量子数の平均値を別途測定する必要があります。これは将来的に追加する可能性があります。
NEQの意味と使い方を理解するには時間がかかります。Tangらによる「従来のCTと比較した差動位相コントラストCTの画像性能の特性評価:ノイズ等価量子スペクトルNEQ(k)」は、医療画像におけるNEQの使用方法の優れた例であり、真の技術的深みがあります。
NEQからの情報容量:
NEQの特殊な形式であるNEQ info ( f ) は、以下を使用して計算されます。は、シャノン・ハートレー方程式の特殊な場合から情報容量C NEQを計算するために使用されます。NEQ 情報はグラフ化されません。
ここで、帯域幅Wはカメラのナイキスト周波数であり、 [著者注:私はこの関連性を発見したと思っていたのですが、それはChristos MichailらによるPETスキャナーとデジタルマンモグラフィに関する論文[ 6,7 ]に記載されていました。医療画像分野以外の人が偶然目にするような論文ではありません。]
理想的な観測者SNR(SNRi)
これは、小さな物体の検出可能性の尺度です。これは、Paul Kane [ 8 ] および Orit Skorka と Paul Kane [ 9 ] の論文で説明されています。
[8]ではSNRi方程式を1次元で示していますが、かなりの努力の結果、[9]の2次元方程式が正しい結果を与えることがわかりました。

G ( ν x ,ν y ) 2 は、 μ 2 ΔS 2 ( ν x ,ν y ) と同じです。 MTF ( ν ) とNPS(ν) は1次元で定義され、空間周波数単位はサイクル/ピクセルであり、線形化された信号は最大値1に正規化されます。
検出対象は通常、寸法w × kw の長方形で、 k = 1 (正方形の場合) または 1×4 アスペクト比の長方形の場合は 4 です。その振幅 (初期解析の場合) は、傾斜したエッジのピークツーピーク電圧です (上の電圧統計図に示されています)。これは通常、コントラスト比が4:1のチャートから得られる。
、
ここで、rect( x ) = 1 (-1/2 < x < 1/2 の場合)、それ以外の場合は 0 です。
G ( ν x ,ν y )は、検出対象Δ g ( x , y )のフーリエ変換です。これは 2 次元で表現されます。
SNRI 2は、周波数の 2 次元配列 (0 から 0.5 c/p まで 51 ステップ) を作成し、そこに以下の値を埋め込むことで数値的に計算されます。これらの周波数は、数値的に合計できる2次元配列を作成するために使用されます[9]。
SNRiは、幅wが1から10までの各カラーチャンネルについて表示されます。より小さなオブジェクトを強調する最新の値は、 w = 1、1.2、1.4、1.7、2、2.5、3、4、7、10です。幅が10を超えるオブジェクトも以前は分析されていましたが、システム性能に関する洞察はほとんど得られませんでした。
オブジェクトの表示
SNRi測定の目的は、小さくてコントラストの低い正方形または4:1の長方形の物体の視認性を予測することです。SNRiの予測は視覚的な確認を必要とします。これを実現できるシミュレーション画像が、古典的なSNRi論文[8]の図3に示されています。
私たちはImatest向けに、実際の斜めエッジ画像とちょっとしたトリックを使ってこれを実現するディスプレイを開発しました。こうした仕掛けはあるものの、データは取得した画像から直接得られたものです。
ここでは、比較的ノイズの少ない画像とノイズの多い画像の 2 つの結果セットを示します (どちらもマイクロ フォーサーズ センサーを搭載したカメラで撮影したもので、ISO はそれぞれ 100 と 12800 です)。正方形の辺の長さはw = 1、2、3、4、7、10、14、20 ピクセルです。元のチャートは 4:1 のコントラスト比 (明/暗 = 4) を持ち、これは Michelson コントラストC Mich ((明-暗)/(明+暗)) が 0.6 に相当します。外側の正方形はC Mich = 0.6 です。中央と内側の正方形は、それぞれC Mich = 0.3 と 0.15 です。
これらの画像の使い方 —端の近くにある目立たないマゼンタ色の バーは、見えにくい小さな正方形を見つけるのに役立つように設計されています。黄色の数字は、ピクセル単位の正方形の幅です。SNRi 曲線は(少なくとも最初は) チャートのコントラストを表し、4:1 (ISO 12233 規格) が強く推奨されます。外側のパッチはSNRi曲線に対応しており、 Rose モデル[ 4 ] によると、SNRi が 5 (14 dB) で視認性の閾値に対応します。

これら2枚の画像ではオリジナルのピクセルのみを使用していますが、テスト対象デバイスと同じぼかし効果のある境界線を持つ正方形を作成するために、ちょっとしたトリックを使いました。
右側のSNRi曲線は、右上のノイズの多いISO 12800画像に対するものです。w = 1の正方形は見えません。w = 2と3の正方形はかろうじて見え、 w = 4の正方形ははっきりと見えます。このグラフでは、 w = 2のSNRiは0~5 dB、 w = 3は5~10 dBで、視認性の閾値が約14 dBであるという予想に近い値となっています。
正方形の作り方
- 必要に応じて画像を拡大し(元の画像の幅が170ピクセル未満の場合)、画像の左右に反転した画像を追加して、すべての正方形を配置できるスペースを確保します。必要に応じて、下部に縦方向に反転した画像を追加します。
- 元の画像全体を(水平方向に)反転させます。これが「ミラー」部分です。
- シェアを使ってマスクを作成します。背景は0、正方形は1です。側面はシャープです。
- MATLABのfilter2関数を使って正方形をぼかします。これが「煙」の部分です。ぼかしカーネルの決定は困難でした。1次元のラインスプレッド関数(LSF)をそのまま2次元で使用するだけでは良い結果が得られないことがわかりました。より複雑な変換が必要でした。
- 2つの画像を線形化する(ガンマエンコーディングを削除する)。
- マスクを使用してそれらを組み合わせ、マスクが0の場合は元の画像を保持し、マスクが1の場合は鏡像を使用し、それ以外の場所でそれらをブレンドします。
- ガンマエンコーディングを再適用してください。
ノイズ自己相関
このグラフはまだ研究開発段階にあるが、デモザイキングと固定パターンノイズの影響を取り除き、主要なノイズ源が光子ショットノイズである場合、ノイズパワースペクトル(および自己相関)がイメージセンサーの電気的クロストーク量を示すという仮説を検証するために追加された。この仮説の根底にある考え方は、センサーに入射する光は完全に無相関であるため、クロストークがなければノイズは白色になるというものである。
右側の画像はホワイトバランス調整済みです。
この曲線は、著者のウィーナー・ヒンチン定理に関する限られた理解に基づくと、ノイズスペクトルの逆フーリエ変換である。
右側の画像はホワイトバランス調整されていません。予想通り、赤色チャンネルの自己相関距離は他のチャンネルよりも大きくなっています。画像をクリックすると拡大表示されます。
同様の自己相関プロットは、画像統計モジュール内のフラットフィールド画像からも取得できます。照明の不均一性を補正することで、遠距離における(偽の)自己相関を低減しています。
シャノン情報容量の意味
(ホワイトペーパー「Imatestによる情報容量の測定」の付録)
(情報に関する簡潔な定義がある。)
電子通信チャネルにおける情報容量とは、チャネルをエラーなく通過できる情報の最大量、つまりチャネルの「良さ」の尺度です。実際の情報量は、コード、つまり情報がどのように表現されるかに依存します。しかし、符号化はデータ圧縮(画像がファイルに保存される方法)に不可欠ですが、デジタルカメラには関係ありません。重要なのは、次の仮説です。
仮説:知覚される画像品質(適切に調整された画像処理パイプラインを前提とする)およびマシンビジョンと人工知能(AI)システムの性能は、カメラの情報容量に比例し、その情報容量はMTF(鮮明度)、ノイズ、デモザイキング、クリッピング(存在する場合)、およびデータ圧縮から生じるアーティファクトの関数である。
これはあくまで仮説、つまり推測を表す数学用語であることを強調しておきます。私の経験や数々の測定結果とは一致していますが、さらなる検証と確認が必要です。Imatestを使えば情報容量を簡単に計算できるようになった今、私たちはそれについてより深く学ぶ機会を得ました。
先に述べたように、情報容量は帯域幅Wと信号対雑音比S/Nの両方の関数です。
|
シャノン容量を紹介するテキストでは、帯域幅Wはしばしば半値周波数と仮定され、これはMTF50と密接に関係しています。厳密に言えば、 W log 2 (1+ S / N )は白色雑音(フラットなスペクトルを持つ)と単純なローパスフィルタ(LPF)の場合にのみ正しいです。しかし、デジタルカメラはシャープネスの度合いが様々であるため、応答曲線は単純なLPF応答から大きく逸脱する可能性があります。このため、シャノン・ハートレー方程式の積分形式を使用します。
SとNは信号電力と雑音電力の平均値であり、カメラのダイナミックレンジ(利用可能な最大信号)とは直接関係ありません。そのため、 Cの計算は測定に使用したチャートのコントラスト比を参照します。最も一般的には、ISO 12233規格に準拠した4:1コントラストチャートの場合はC 4 が用いられます。 シーメンススター解析では、ピクセルの二次元性を考慮するため、この式を二重積分に変換し、極座標形式に変換した後、再び一次元形式に戻すことで変更しました。しかし、傾斜エッジの場合は既に一次元であるため、この変更は必要ありませんでした。 |
シーメンススター法とスラントエッジ法のどちらの利点も、信号電力Sと雑音電力Nが同じ位置から計算される点にある。これは、雑音が画像全体で一定ではないことが多いため、重要な点である。
まとめ
- シャノン情報容量Cは、電子通信チャネルの良し悪しを測る尺度として長年使われてきました。これは、適切な符号が使用された場合、データがエラーなく伝送できる最大速度を規定するものです(シャノン容量に近づく符号を見つけるのに半世紀近くかかりました)。画像処理では符号化は問題になりません。 1962年のロドニー・ショーの論文[ 10 ]と1961年のR・クラーク・ジョーンズの論文[12]は、写真フィルムのCを測定した良い(そして珍しい)例です。当時は容易ではありませんでした。
- Cは通常、ピクセルあたりのビット数で測定されます。総容量は。
- Cを計算する前に、チャネルを線形化する必要があります。つまり、 Sと N の正しい値を取得するには、適切なガンマ補正 (信号=ピクセル レベルのガンマ、ここで sRGB や Adobe RGB などの標準色空間の画像の場合、ガンマ≅ 2.2 ) を適用する必要があります。ガンマの値 (2 に近い値) は、グレースケール ステップ チャートを分析するImatestモジュール ( Stepchart 、 Colorcheck 、 Color/Tone 、 Multitest 、 SFRplus 、 eSFR ISO)のいずれかを実行することで決定できます。ただし、ほとんどの場合、チャートのコントラストを入力し、 「MTF に使用」にチェックを入れると、エッジ 画像から決定できます。
- Cは、特にマシンビジョンや人工知能カメラのカメラ品質を評価するための指標として使用できると我々は仮説を立てています。(ただし、消費者向けカメラの外観に直接反映されるわけではありません。なぜなら、消費者向けカメラは潜在能力を最大限に発揮し、魅力的な画像を生成するために、綿密な調整が必要だからです。)Cは、特に最小限の処理を施したRAW画像から変換した画像を使用する場合、カメラを比較するための公平な基準となります。
- Imatestは、デジタル画像のY(輝度)チャネルのシャノン容量Cを計算します。これは、人間の目の感度を近似したものです。また、個々のR、G、BチャネルのC、およびCbとCrの色度チャネル( YCbCrから算出)のCも計算します。
- シャノン容量は、計算や解釈が困難であったため、これまで写真画像の特性評価には用いられてこなかった。しかし現在では容易に計算できるようになり、写真画像の品質との関係性について研究が進められている。
- Cは新しい測定指標であるため、人工知能システムへの適用可能性を検証できる企業や学術機関との連携を希望しています。
注:Imatest 2020以前に使用されていた、主にシーメンス社のスター測定から総情報容量を取得するために使用されていた傾斜エッジ情報容量測定法は、精度が十分ではなかったため、完全に廃止されました。 |
リンク( ホワイトペーパーにもっと多くのリンクがあります)
- CE Shannon、「 通信の数学的理論」、Bell Syst. Tech. J.、vol. 27、pp. 379–423、1948 年 7 月; vol. 27、pp.
623~656ページ、1948年10月。 - C.E. シャノン、「 騒音下における通信」、IRE 会議録、1949 年 1 月、10-21 ページ。
- Wikipedia – シャノン・ハートレーの定理には、シャノンの方程式の周波数依存積分形式があり、これはImatestの正弦パターンと傾斜エッジのシャノン情報容量計算の両方に適用されます。
- IA Cunningham および R. Shaw、 「医療画像システムの信号対雑音比の最適化」、第 16 巻、第 3 号、1999 年 3 月、pp 621-632、J. Opt. Soc. Am. A
- Brian W. Keelan、「ノイズ等価量子イメージングアプリケーション」 、Proc. IS&T Int'l. Symp. on Electronic Imaging: Image Quality and System Performance XIII 、2016、 https://doi.org/10.2352/ISSN.2470-1173.2016.13.IQSP-213 。
- Michail C、Karpetas G、Kalyvas N、Valais I、Kandarakis I、Agavanakis K、Panayiotakis G、Fountos G.、 「陽電子放出断層撮影スキャナーの情報容量」 。Crystals。2018; 8(12):459。https ://doi.org/10.3390/cryst8120459 。
- Christos M. Michail、Nektarios E. Kalyvas、Ioannis G. Valais、Ioannis P. Fudos、George P. Fountos、Nikos Dimitropoulos、Grigorios Koulouras、Dionisis Kandris、Maria Samarakou、Ioannis S.Kandarakis、「デジタル マンモグラフィーにおける画質と情報容量の図」、 BioMed Research International 、vol. 2014 年、記事 ID 634856、11 ページ、2014 年。 https://doi.org/10.1155/2014/634856 。
- Paul J. Kane、「信号検出理論と自動車画像処理」、 Proc. IS&T Int'l. Symp. on Electronic Imaging: Autonomous Vehicles and Machines Conference 、2019、pp 27-1 - 27-8、 https://doi.org/10.2352/ISSN.2470-1173.2019.15.AVM-027 。
- Orit Skorka、Paul J. Kane、「理想的なオブザーバモデルを使用した物体検出」、 IS&T 国際シンポジウム「電子画像処理:自律車両と機械」 、2020 年、pp 41-1 - 41-7、 https://doi.org/10.2352/ISSN.2470-1173.2020.16.AVM-041 。
- R. Shaw、「 フーリエ変換技術と情報理論を用いた写真画像品質評価への応用」 、Photographic Science and Engineering、第6巻、第5号、1962年9月~10月、281~286ページ。Rodney Shaw編集の「Selected Readings in Image Evaluation」、SPSE(現SPIE)、1976年に再録。写真フィルムの情報容量に関する、興味深くも難解な計算。 ダウンロード可能。
- X. Tang、Y. Yang、S. Tang、「従来のCTと比較した差動位相コントラストCTの画像性能の特性評価:ノイズ等価量子NEQ(k)のスペクトル」、 Med Phys. 2012年7月; 39(7): 4467–4482。2012年6月29日オンライン公開。doi : 10.1118/1.4730287 。
- R. クラーク・ジョーンズ、「写真フィルムの情報容量」、米国光学会誌、第51巻、第11号、1961年11月、1159-1171ページ
付録1:情報理論の簡単な紹介

挑戦こそ至福の時!電子通信チャネルには、エラーなく伝送できる情報量の最大値を定量化する指標が存在する。この指標には、鮮明度とノイズ(フィルムの粒子)が含まれる。そして、カメラ、あるいはあらゆるデジタル画像システムは、まさにそのようなチャネルなのである。
ベル研究所のクロード・シャノン*が1948年に初めて発表したこの指標[ 1,2 ]は、電子通信産業の基礎となっている。これはシャノンチャネル容量またはシャノン情報容量Cと呼ばれ、一見単純な式で表される[3]。(詳細はシャノン・ハートレーの定理に関するWikipediaのページを参照。)
W チャネル帯域幅は、 S ( f ) は平均信号エネルギー(信号の二乗)です 電圧。MTF ( f ) 2に比例し、 N ( f )は平均ノイズエネルギー (RMS ノイズ電圧の二乗) であり、フィルムのグレインに対応します。見た目は十分にシンプルですが ( E = mc 2より少し複雑なだけです)、適用するのは簡単ではありません。
クロード・シャノンは真の天才でした。 『クロード・シャノンと過ごした1万時間:天才の思考、仕事、そして生き方』という記事は素晴らしい読み物です。 ニューヨーカー誌やサイエンティフィック・アメリカン誌にも、シャノンに関する興味深い記事が掲載されています。また、IEEEには、シャノンと機械学習およびAIの発展を結びつけた記事があります。特に興味深いのは、29分間のビデオ「クロード・シャノン ― 情報化時代の父」です。これは、私が以前の仕事で頻繁に訪れていたUCSD記憶・記録研究センターが制作したものです。
付録2.線形センサの最大情報容量Cmaxの計算ステップ1:測定されたピークツーピーク電圧範囲Vppを最大許容値Vp -p_max = 1に置き換えます。これは簡略化のように見えるかもしれませんが、ほとんどのカメラでうまく機能します。信号電力Sのセクションを参照してください。 ステップ2:測定されたノイズ電力NをN平均(0 ≤ V ≤ 1の範囲におけるNの平均、ここで1は最大許容正規化信号電圧V )に置き換えます。線形イメージセンサのVの関数としてのノイズ電力Nの一般式は次のとおりです。 k 0は定常ノイズ(暗電流ノイズ、ジョンソン(電子)ノイズなど)の係数です。k 1 は光子ショットノイズの係数です。これらは、エッジ遷移の両側で信号電圧V 1とV 2とともに測定されるノイズ電力N 1 = σ 1 2とN 2 = σ 2 2から計算されます。 N 1 = k 0 + k 1 V 1およびN 2 = k 0 + k 1 V 1と仮定すると、 k 0とk 1の 2 つの未知数に関する 2 つの方程式を解くことができます。 Nは、ノイズ計算方法(1)(バイラテラルフィルタリングのない最小限の処理画像に使用)で使用されるノイズに非常に近い値です。しかし、方法(2)(平滑化されたピークノイズ)(バイラテラルフィルタリングを使用したカメラ内JPEGに推奨)を使用する場合は、 Nは一般的に大きくなるため、修正する必要があります。 N → k N N 、ここでk N = N method_2 / N Method_1 バイラテラルフィルタ処理された画像(一般向けカメラで撮影されたJPEG画像のほとんど)では、ローパスフィルタ処理(ノイズ低減のため)がN1とN2に強く影響するため、上記の式が必ずしも成り立たない場合があります。これはCmaxの精度に悪影響を及ぼす可能性があります。 C maxを計算するための0 ≤ V ≤ 1 の範囲における平均雑音電力N meanは まれではあるが、エッジの暗い側でノイズが大きい場合(奇妙な画像処理)に対処するには、 N mean = max( N mean , N 1 ,N 2 )を使用します。 使用 、 ハイダイナミックレンジ(HDR)センサーのノイズは、リニアセンサーの単純な方程式に従わないため、画像の明るい側が飽和に近い(ただし確実に飽和以下)になるように十分な露出を与え、 Nは変更しない( N平均= N )ことを推奨します。 線形センサーを使用した最小限または均一に処理された画像の場合、 C maxは露出にほとんど依存せず、ノイズ電力Nは信号電圧Vの既知の関数です。 |
付録3. ビニングノイズビニングノイズは、 量子化ノイズと統計的に同一であり、最近発見されたISO 12233ビニングアルゴリズムのアーティファクトです。これは、画像遷移付近で最大になります。これは最大値であり、情報容量の測定に影響を与える可能性があります。これは、個々の走査線が、走査線の中心位置に対する多項式近似に基づいて4つのビンのいずれかに追加されるためです。この多項式近似は連続関数です。 n個の同一信号μ s ( x )が区間{-Δ/2, Δ/2}にビン分割されると仮定します。ここで、Δ はビン分割アルゴリズムの 4 倍オーバーサンプリング出力における 1 です (Δ = (元のピクセル間隔)/4 であることに注意してください)。ビン分割ノイズがない場合、ビン分割ノイズ電力σ Bnoise 2はゼロになると予想されます。しかし、 μ s ( x k )の値は区間 Δ にわたって均一に分布した位置x kで合計されるため、値は となります。 線広がり関数LSF (x) の場合。δ は {-1/2, 1/2} 上で一様分布していることに注意して、 一様分布の分散の式( 量子化ノイズと同様) を適用すると、次の式が得られます。 。 この方程式にはいくつかの近似が含まれていますが、補正されたノイズを計算することには良好な結果が出ています。 ビニングノイズは、従来のMTF計算には影響を与えません。 ![]() マイクロフォーサーズカメラのRAW画像(ISO 100)を最小限の処理でTIFF形式に変換したもの。 ビニングノイズは、バイラテラルフィルタリング(非均一シャープニング)を施したJPEGファイルにも影響を与えます。ノイズを除去することで、計算の精度が向上します。 |










