このスライドでは Pythonでデータを取り扱う際に使用される 「リスト」 「numpy(ナンパイ)」 そして「pandas(パンダス)」について説明します
これらの違いや利点を理解し データ分析の効率を大きく向上させましょう
このスライドでは Pythonでデータを取り扱う際に使用される 「リスト」 「numpy(ナンパイ)」 そして「pandas(パンダス)」について説明します
これらの違いや利点を理解し データ分析の効率を大きく向上させましょう
まず初めに、「リスト」、「numpy(ナンパイ)」、そして「pandas(パンダス)」で同じ処理を見てみましょう。
それぞれの機能を使ってデータの作成、取り出し処理を記述します。微妙な記述の違いに注目してください。
三つの機能で同じ処理を行っていますが、特に注目してほしいのは、import文の有無と、データを格納する際の記述の違いです。
リストはPythonの標準機能であるためimport文は不要です。それに対して、numpyやpandasは外部ライブラリのため、import文が必要です。
リストだけではダメなのかな
なぜリスト以外のものを使用するのでしょうか?
それぞれの機能には、メリットとデメリットがあります。まず、「リスト」はPythonに最初から用意されている機能で、追加ライブラリのインストールやimport文は不要です。気軽に使えるのがメリットですが、numpyやpandasに比べて計算の速度が遅く、大量のデータを扱う場合には適していません。
数件のデータであれば計算速度は大きな問題ではないかもしれません
しかし 何百万から何千万という大量のデータを扱う際には 計算速度が極めて重要となります
もし 1件あたりの計算速度が0.1秒遅い場合、百万件のデータを処理すると10万秒の遅延が生じます
人間が目で簡単に数えられる程度のデータ件数なら リストでも問題ないけど データの件数が多い場合は numpyやpandasを使用したほうが良いってことか
「numpy(ナンパイ)」は大量のデータ、特に数値データを効率的に処理することのできるライブラリで、高速な数値計算が可能です。
numpyを利用するには、numpyライブラリのインストールとimport文が必要です。
数値データを大量に計算する場合は numpyが向いているんですね
「pandas(パンダス)」は表形式のデータを効率的に扱うためのライブラリです。
処理速度はnumpyに劣るものの、pandasのDataFrame(データフレーム)という機能を利用することで、表形式のデータを扱いやすくなります。データフレームは初心者にも使いやすく、データの前処理に関する機能も充実しています。
3つの機能の特徴
データを取り扱う3つの方法をご紹介しました
それぞれの特徴を理解し 用途に合わせて使い分けていきましょう