電話 0422-27-7828チャットで質問無料相談を予約

武蔵野個別指導塾の特徴

度数分布と箱ひげ図から統計的推測、統計学へ|武蔵野個別指導塾

同じ平均でもデータの姿が違う理由を、箱ひげ図と標準偏差で確かめます。信頼区間や仮説検定までたどり、数字から言えることを自分の言葉で説明する視点を育てましょう。

武蔵野個別指導塾の教室 武蔵野個別指導塾

度数分布と箱ひげ図から統計的推測、統計学へ

平均が同じなら、同じ集団でしょうか

よくあるのは、放課後の図書館の閲覧席で、学習時間を記録したノートを広げ、「平均さえ出せば、箱ひげ図は要らないのでは」と手が止まる場面です。平均を求める計算はできています。それなのに、さらに中央値や四分位数を調べる理由がつかめません。統計の勉強が、似た数字を何度も出す作業に見えてしまいます。

ところが、毎回ほぼ同じ時間だけ取り組む人と、短い日も長い日もある人では、平均時間が等しくても生活の様子が違います。平均は全体を一つの数にまとめる便利な道具ですが、まとめたときに消える情報もあります。統計では、どの情報を残すと問いに答えられるかを考えます。

中学では、手元のデータを表や図にして、中心と散らばりを読み取ります。高校では、散らばりを数で測り、一部のデータから全体を推測します。大学では、その推測の方法がどんな条件で信用できるかを調べます。道具は増えても、「この数字を根拠に、どこまで言えるか」という問いは続いています。

武蔵野個別指導塾

中学の表と箱ひげ図は、分布を見渡す道具です

まず、学習時間を分で記録した次のデータを考えます。

10, 10, 20, 20, 30, 30, 40, 80

データの個数は8、合計は240なので、平均値は240 ÷ 8 = 30分です。平均値は、合計を個数で割った代表値です。代表値とは、データの中心的な傾向を一つの数で表すものです。ただし、「代表」という名前でも、全員がその値に近いことまで意味するわけではありません。

中央値は、小さい順に並べたときの中央の値です。個数が偶数なら中央の2個の平均を取ります。このデータでは4番目が20、5番目が30なので、中央値は25分です。平均値が30分なのに中央値が25分なのは、80分という大きな値が平均値を押し上げているためです。順序に注目する中央値と、すべての値を足す平均値では、値の変化への反応が異なります。

最頻値は、最も多く現れる値です。このデータでは10、20、30がそれぞれ2回ずつ現れるので、どれも最頻値です。平均値、中央値、最頻値を求めたら、答えを並べるだけで終えず、なぜ違うのかを元のデータに戻って説明してみましょう。

データが多くなったときは、値をいくつかの区間に分けます。この区間を階級といい、各階級に入るデータの個数を度数といいます。上のデータを幅20分の階級に分けると、0分以上20分未満が2個、20分以上40分未満が4個、40分以上60分未満が1個、60分以上80分未満が0個、80分以上100分未満が1個です。これを整理したものが度数分布表です。

境界にある20分は、20分以上40分未満の階級に入ります。「以上」と「未満」を読み落とすと、同じデータを重ねて数えたり、どこにも入れなかったりします。すべての度数の合計が8になることを確かめれば、分類の点検にもなります。相対度数は、各階級の度数を全体の個数で割った値で、この階級の相対度数は4/8 = 0.5です。

ヒストグラムは、階級を横軸に取り、分布を長方形で表す図です。階級の幅が等しい場合は、度数を高さにできます。幅が異なる場合は、長方形の面積が度数に対応するように高さを調整する必要があります。山の位置や左右の伸び方から、分布の偏りを読み取れます。ただし、階級の切り方によって見え方も変わります。

箱ひげ図では、並べたデータを区切る四分位数を使います。ここでは上下半分の中央値を、それぞれ第1四分位数、第3四分位数とする方法で計算します。下半分は10、10、20、20なので第1四分位数は15、上半分は30、30、40、80なので第3四分位数は35です。第2四分位数は全体の中央値25です。

四分位範囲は第3四分位数から第1四分位数を引いた値で、35 − 15 = 20分です。箱ひげ図の箱は15から35まで伸び、箱の中に中央値25の線を入れます。ひげを最小値と最大値まで伸ばす形式なら、両端は10と80です。箱は中央付近の散らばりを、ひげは端までの広がりを見せます。箱の長さが短くても、端に大きな値があることはあり得ます。

四分位数の計算法やひげの描き方には複数の流儀があります。問題文や使う道具の約束を確かめたうえで比較しましょう。また、箱ひげ図から個々の値や細かな山の形まで復元することはできません。表、ヒストグラム、箱ひげ図は、それぞれ異なる情報を残しているのです。

高校では散らばりを測り、見ていない全体を考えます

高校で学ぶ分散は、平均からのずれを二乗し、その平均を取った量です。例えば、Aを2、4、6、Bを0、4、8という二つのデータとします。どちらも平均値は4ですが、Bのほうが中心から離れています。この違いを、一つの数にして比べたいところです。

平均からのずれをそのまま足すと、Aでは負のずれと正のずれが打ち消し合って0になります。Bでも同じです。そこで二乗し、離れているほど大きな値になるようにします。個数で割る形の分散は、次のように求まります。

Aの分散 = ((2 − 4)² + (4 − 4)² + (6 − 4)²)/3 = 8/3

Bの分散 = ((0 − 4)² + (4 − 4)² + (8 − 4)²)/3 = 32/3

標準偏差は分散の正の平方根、分散が0のときは0です。Aの標準偏差は√(8/3)、Bは√(32/3)で、BはAの2倍です。分散で比べると4倍になります。元の値を分で測ったなら分散の単位は分の二乗ですが、標準偏差なら分に戻ります。元のデータと同じ単位で散らばりを考えられるのが便利な点です。

四分位範囲は並び順をもとに中央付近を見るのに対し、分散はすべての値と平均からの距離を使います。そのため、端の値が大きく動いたときの影響は同じではありません。測り方によって、敏感に捉える特徴が異なります。

ここまでは、手元にあるデータを要約してきました。統計的推測では、調べたい対象の全体である母集団と、そこから取り出した標本を区別します。標本の平均値である標本平均を使って、母集団の平均値である母平均を推測するのが、その一例です。抽出し直せば標本は変わり、標本平均も変わります。

この変動を表すために確率分布を使います。正規分布は、平均を中心として左右対称の釣り鐘形の密度曲線を持ち、平均と分散によって定まる連続的な確率分布です。密度曲線の下の面積が、その区間に値が入る確率を表します。実際のデータがいつも正規分布に従うわけではなく、分布の形を仮定してよいかを考える必要があります。

区間推定を、条件のはっきりした例で見ましょう。母集団が正規分布に従い、母標準偏差が10とわかっているとします。そこから独立に同じ分布で25個の観測を得て、標本平均が50だったとします。標本平均の標準偏差は10/√25 = 2です。これは標準誤差と呼ばれ、個々の観測の散らばりと、平均の散らばりを区別します。

母平均の約95%信頼区間は、標本平均の左右に標準誤差の約1.96倍を取って作れます。この例では50 − 1.96 × 2から50 + 1.96 × 2まで、すなわち46.08から53.92までです。約1.96は、標準正規分布の中央に約95%の確率が入る境界に由来します。

95%という数値は、同じ抽出と区間作成を繰り返したとき、作られる区間の約95%が固定された母平均を含む、という方法の性質です。観測後のこの区間について、固定された母平均が95%の確率で動いて入る、という意味ではありません。また、母標準偏差が未知なら、それを既知として同じ式を当てはめることはできず、別の扱いが必要になります。

仮説検定では、「母平均は45である」のような帰無仮説を置きます。先ほどの条件なら、観測された平均50のずれは標準誤差の2.5倍です。両側検定では、帰無仮説のもとで左右どちらにもこれ以上離れる結果の確率を調べ、あらかじめ決めた有意水準と比べます。小さければ帰無仮説を棄却しますが、棄却できない場合にも帰無仮説が正しいと証明されたわけではありません。

武蔵野個別指導塾の自習室 武蔵野個別指導塾

大学では、推測の方法そのものを評価します

大学の統計学では、観測値を代入して答えを出す前に、標本が変わることで答えがどう変わるかを考えます。ここで重要なのが推定量です。推定量とは、未知の母数を推定するために、標本から計算するよう定めた関数で、未知の母数そのものを計算に含めないものです。母数とは、母平均や母分散のように、考えている分布を特徴づける未知の値です。

標本平均は母平均の推定量です。データを得る前には標本平均も確率的に変動する量であり、実際のデータから計算して得た具体的な数を推定値と呼びます。

推定量の性質の一つに不偏性があります。不偏であるとは、想定したモデルの各母数のもとで、推定量の期待値が推定したい母数に等しいことです。期待値は、取り得る値をその起こりやすさで重みづけした平均に当たります。不偏性は、繰り返し標本を取ったときの平均的なずれが0になる性質であって、一度の推定が必ず真の値に一致する性質ではありません。

独立で同じ分布に従う標本を考え、母平均が有限なら、標本平均は母平均の不偏推定量です。さらに母分散が有限なら、標本平均の分散は母分散を標本の個数で割った値になります。高校で使った標準誤差の式は、この関係の平方根を取ったものです。式を覚える段階から、何を仮定すればその式が成り立つかを確かめる段階へ進みます。

分散の推定では、標本平均からのずれの二乗を足し、標本の個数から1を引いた数で割る不偏分散を学びます。独立で同じ分布に従い、母分散が有限な場合、この計算が母分散の不偏推定量になります。高校でデータ自体の散らばりを表すために個数で割った分散と、母分散を推定する目的の不偏分散を区別しましょう。

個数で割ると平均的に小さくなる理由は、標本自身から選んだ標本平均を中心にしていることにあります。標本平均は、その標本についてずれの二乗和を最小にする位置です。未知の母平均からのずれを直接測った場合より、散らばりを小さく見積もりやすくなります。分母の変更には、このずれを補う数学的な理由があります。

もう一つの性質が一致性です。推定量が一致性を持つとは、標本の個数を増やすと、推定量と真の母数との差が、どんな固定した正の幅を超える確率も0に近づくことです。不偏性が繰り返しの平均的な位置を見るのに対し、一致性はデータを増やした先の集中の仕方を見ます。両者は別の性質で、名前の印象だけで同一視しないことが重要です。

検定も、正解を必ず見抜く装置として扱うのではなく、誤りの起こり方を管理する方法として学びます。帰無仮説が正しいのに棄却するのが第1種の誤りです。有意水準は、その誤りの確率を制御するために定めます。一方、帰無仮説が誤っているのに棄却できない第2種の誤りもあります。観測の個数や変動の大きさ、検出したい差によって、見つけやすさが変わります。

p値は、帰無仮説のもとで、採用した検定統計量が観測結果と同じかそれ以上に極端になる確率です。「帰無仮説が正しい確率」ではありません。また、小さなp値だけでは差の実用的な大きさまで伝わりません。推定された差や信頼区間も合わせて見て、何がどれほど変わったのかを考えます。

情報分野で、学習アプリの利用時間と課題の正答数の関係を調べる場合を考えましょう。一方が大きいほど他方も大きい傾向があれば、正の相関があるといいます。しかし、もともとの学習への関心が両方に影響しているかもしれません。相関から、利用時間を増やせば正答数が増えるという因果関係へ、そのまま進むことはできません。

因果関係を調べるには、介入によって何が変わるかを考えます。条件を無作為に割り当てる実験は、背景の違いが特定の条件に偏るのを抑える方法です。ただし、データの欠落や測り方なども点検します。計算の高度さだけでなく、データがどう作られたかが結論を支えます。

一本の線は、情報を残して判断することです

中学の代表値と図は、手元のデータを短く伝えるための道具です。高校の区間推定は、手元にない全体について、推測の不確かさも含めて伝えます。大学の推定量や検定の理論は、その伝え方がどんな条件でどのように働くかを保証しようとします。対象は、データの形から、標本の変動、さらに方法の性質へと広がります。

変わらないのは、数字を出した後に元の問いへ戻る姿勢です。平均値を出したなら何の中心なのか、標準偏差を出したなら何が散らばっているのかを確かめます。信頼区間なら何の母数を推定したのかを言い添えます。「計算結果は合っている」と「問いに答えている」は、別々に確かめる必要があります。

変わるのは、目の前のデータを越えて話すための条件です。ある日の記録を要約するだけなら、その日のデータを整理できます。しかし、翌日や別の集団にも同じことを言いたいなら、日や人の選び方を考えなければなりません。標本の個数を増やしても、偏った取り方が自動的に直るとは限りません。

箱ひげ図を読むときに「この図からは何が言えないか」と考える経験は、この先にも残ります。統計の道具を学ぶとは、情報をまとめる力と、まとめたときに落ちた情報を意識する力を、同時に育てることなのです。

つながりを使った学び方

最初の手順は、計算前に対象と単位を書くことです。「誰の、いつの、何を測ったデータか」を短く言葉にします。練習問題でも、観測の個数と測定値を区別しましょう。人数を表す8と時間を表す80を、同じ種類の数字として読み流さないことが、表や図の読み違いを防ぎます。

次に、同じデータを表、図、言葉に移し替えます。度数分布表を作り、ヒストグラムの山を説明し、平均値と中央値の違いを元の値に戻って確かめます。すべてを毎回作る必要はありません。「この問いなら、どれを見ると答えやすいか」まで一言添えると、計算の目的がはっきりします。

その次は、一つの値だけを動かして結果を予想します。最大値をさらに大きくしたとき、平均値や中央値、箱の長さがどう変わるかを、計算の前に考えます。予想と結果が違えば、どの値を使う定義だったかを読み直します。公式を見て思い出すだけでなく、変化を説明できるかで理解を点検できます。

高校の推測では、結論の横に条件を書きます。無作為に抽出したのか、独立と考えられるのか、母標準偏差は既知なのかを確認します。そして「この標本の平均はこうだった」と「母平均をこう推測する」を別の文にします。大学で推定量の性質を学ぶときも、この区別が土台になります。

塾では、答えがずれた箇所を計算、定義、読み取りに分けて確かめます。例えば四分位範囲の誤答なら、並べ替え、上下の分け方、引き算のどこでずれたかを見ます。正解した場合も、図から言えることを説明してもらい、数値と解釈を結びつける練習を組みます。

家庭では、お子さまの説明を聞く時間を持ち、「その平均は何の平均かな」と問いの対象を確かめる役が持てます。難しい式の先取りより、ノートの表と本人の言葉が対応しているかに目を向けてみてください。うまく説明できなかった部分を次の学習へ持ち込めれば、疑問を曖昧なまま残さずに進められます。

よくある質問

平均値と中央値は、どちらを使えばよいですか

問いに応じて選びます。合計との関係を知りたいなら平均値、順番で見た中央を知りたいなら中央値が役立ちます。大きな値や小さな値が少数ある場合には、両方を比べると分布の特徴が見えてきます。片方だけを常に正しい代表と決めず、選んだ理由を説明しましょう。

箱ひげ図だけで平均値を求められますか

一般には求められません。箱ひげ図は四分位数や端の位置を伝えますが、すべての値を示してはいないからです。同じ箱ひげ図になるデータでも、内部の値が違えば平均値が異なることがあります。箱の中央の線は中央値を示す、という約束も確認してください。

仮説が棄却されなければ、差がないと言えますか

差がないと断定することはできません。観測の個数が少ない、散らばりが大きいなどの理由で、差を捉えきれていない場合もあります。検定結果だけを切り取らず、推定した差の大きさや信頼区間を併せて読み、どの程度の違いが残るのかを考えます。

統計の学習では、正しく計算した後に、もう一歩だけ言葉を足してみましょう。「中央付近はまとまっている」「端に大きな値がある」「母集団について話すには抽出方法を確かめたい」。その一歩が、中学の図から大学の推測へ続きます。武蔵境で数学を学ぶときも、手元の表を自分の言葉で読み直すところから始められます。箱ひげ図を読む一人ひとりの言葉が、武蔵野個別指導塾の統計の授業を進める出発点です。

本気になった日が、入塾の日。

お子様の教育、迷ったら「丸投げ」してください。必ず、期待以上の結果で返します。武蔵野で育む、武蔵境で学ぶ。

電話は年中無休。365日、24時間、お電話可能。

お電話 チャットで質問チャット