スキップしてメイン コンテンツに移動

!3. オープンアクセス

20080128追記: タイトルをちょっと変更した。ITというかプログラムが書けたりデータ解析ができる人向けという感じで書いたつもりだったのですがITとどっちがオープン化的な捉え方をされた方もいたようなので。タイトルがそうだから誤解させてしまったようです。

[[研究とかをオープンにすること|http://d.hatena.ne.jp/syou6162/20080124/1201106105]]で引用されたの詳細を書いてみた.
<<<
こんなこと考えてたらバイオはオープンな感じだよ、って教えてもらったのを思いだす
* そしたら「オープンアクセス」っていうのを教えてもらった
o Open Access Japan | オープンアクセスジャパン
o 急増する「オープンアクセス」方式の学術誌 | WIRED VISION
>>>

バイオ研究のどのへんがオープン化を紹介しますよ.バイオ研究がオープンな理由を3つに分けて説明します.

ただし,そもそもオープンバイオ研究会などを主催しているだけあってバイアスがあったり,異分野のひとにわかるようにover simplifyしていたり,良い面だけ書いているところがあることも注意してください(倫理面や実験の難しさなどの問題).

バイオ,特にゲノミクスと呼ばれている分野で使われているプログラムは多くがオープンソースです.今はどうかわかりませんが,PerlモジュールのレポジトリCPANでもっとも巨大なモジュールであるBioPerlなどはその例のひとつです.GD.pmやCGI.pmなんかもゲノムデータを表示するために作られたものです.また統計解析パッケージのRの中のひと[[http://gentleman.fhcrc.org/|http://gentleman.fhcrc.org/]]もバイオの人が中心です.

いわゆるヒトゲノム計画の成果であるヒトゲノム配列を公開するサイトである[[Ensembl|http://www.ensembl.org/]]はこのサイトのデータとソースコードがすべて公開されています.ちなみにPerl + JavaScriptが中心ですね.

バイオでは遺伝子などのDNA配列(いわゆるATGC)は基本的に公開しなければ論文を通すことができません.国際塩基配列データベースというところにデータを公開しなければならない義務があります.これは誰もが再利用できます.このようなデータ公開のアクティビティは塩基配列データだけでなく,ある遺伝子が体のどこでどのぐらい存在しているかを調べた発現情報,ヒトゲノムそのものなどがオープンデータになっています.

さらにこれらのデータのデータベースを作ることが研究として認められています.データの標準化なども進んでおり,多くのデータがFTPやWebサイトなどからだけでなく,SOAP, RESTなどwebサービスを介してやりとりすることができます.

お酒を分解する酵素の遺伝子配列をウェブサービスを使ってゲットするには
http://eutils.ncbi.nlm.nih.gov/entrez/eutils/efetch.fcgi?db=nucleotide&rettype=xml&retmode=text&id=Adh1
とします.

ヒトゲノムプロジェクトで決定されたY性染色体の全配列を以下のURLから誰でも得ることができます.
ftp://ftp.ncbi.nih.gov/genomes/H_sapiens/CHR_Y/hs_ref_chrX.fa.gz

先に紹介したensemblのMySQLサーバに直接アクセスして提供しているデータベースの一覧を得るには以下のようにすればよいでしょう.
$ echo 'show databases' | mysql -u anonymous -h ensembldb.ensembl.org

バイオを中心に論文そのものを誰もが無料で見れるようにしようという活動があります.膨大なデータや知識を必要とする生物学では他分野の論文を広く読む必要があったりします.論文がオープンでないとなかなかデータの解釈に困ることがありますが,オープンアクセスはそれを解決し科学を促進させる方法のひとつです.オープンアクセスについてはググれば日本語のリソースがたくさんあるのでそちらに解説は譲ります.http://www.openaccessjapan.com/

極端な例では論文をブログのようにTrackbackやコメント(tDiaryでいうところのつっこみ)で評価しようという試みも真面目に取りくんでいます.http://www.plosone.org/

また実験技術や論文などを動画で共有するサービスも始まっています.http://www.jove.com/

もちろん,実際の研究経過や真似されやすい研究は慎重に隠しますよ.それにバイオといっても化学寄りなどクローズドな感じの分野もあります.製薬会社なんかもハンパなくクローズドです.ただ出せるものは積極的に公開していこうという空気がバイオにはあります.ウェブのコンテンツなどは簡単に手にはいるオープンデータですが,バイオもかなり大量の未解析(あるいは解析が足りない)データが公開されているわけです.統計やプログラミングを武器とするひとが参入するには面白い分野ではないでしょうか.

気が向いたらどのような統計やIT技術が期待されているか,どのようにして学ぶのかなどを書くかも.
----
蛇足だが,アニメをみてAR・VR,ロボット研究を始めたっていう聞くけど,エヴァとか綾波レイとかピカチューとかキラヤマト(コーディネーター),攻殻機動隊の少佐(脳科学的な意味で)を作りたいからバイオやります,というという猛者がいてもいいと思う.本当にやったら倫理的にまずいけどね(ジーンダイバーはVR+AR+バイオだったよな,アレ大好き).アマチュア天文学者がいるようにアマチュアのコンピュータ系のバイオロジストがいてもいい.

コメント

このブログの人気の投稿

シーケンスアダプタ配列除去ツールまとめ

FASTQ/A file からシーケンスアダプター配列やプライマー配列を除くためのプログラムをまとめてみる。 まず、配列の除去には大別して2つの方向性がある。ひとつは、アダプター配列を含む「リード」を除いてしまう方法。もうひとつは除きたい配列をリードからトリムする方法である。後者のほうが有効リードが増えるメリットが、綺麗に除ききれない場合は、ゲノムへのマップ率が下がる。 気をつける点としては、アダプター/プライマーの reverse complement を検索するかどうか。paired end の際には大事になる。クオリティでトリムできるものや、Paired-end を考慮するものなどもある。アダプター/プライマー配列の文字列を引数として直接入力するものと、multi fasta 形式で指定できるももある。 From Evernote: シーケンスアダプタ配列除去ツールまとめ TagDust http://genome.gsc.riken.jp/osc/english/software/src/nexalign-1.3.5.tgz http://bioinformatics.oxfordjournals.org/content/25/21/2839.full インストール: curl -O http://genome.gsc.riken.jp/osc/english/software/src/tagdust.tgztar zxvf tagdust.tgz cd tagdust/ make sudo make install rehash 使いかた: tagdust adapter.fasta input.fastq -fdr 0.05 -o output.clean.fastq -a output.artifactual.fastq 解説: 入出力形式は fastq/a が使える。リード全体を除く。速い。アダプター配列を fasta 形式で入力できるのが地味に便利で、これに対応しているものがなかなかない。Muth–Manber algorithm (Approximate multiple

DNAを増幅するサーマルサイクラーを自作してみたよ

DNAをPCR法で増幅するために必要なサーマルサイクラーを自作してみました。自作と言っても、いわゆる、PCの自作と同じでパーツを組み立てていく感じです。購入から組み立ての様子を簡単に紹介します。 モチベーション ラボには様々なレクリエーションがあります。例えば、単にどこかに遊びに行ったり、スポーツ大会したり、ひたすら合宿形式でプログレスのプレゼンをするミーティングするなどがあります。それもよいのですが、せっかくなので、普段の研究時間ではトライできないが、研究に関わる hack を行う、というイベントを企画してみました。夏休みの自由研究や社会科見学的なノリです。   うちのラボでは、PCRを使ったウェットの実験技術の開発をしてきました。しかし、サーマルサイクラーのハードウェアの仕組みを体験的に理解している訳ではありません。そこで、サーマルサイクラーを作ってみました。   欧米で始まっている、自宅のガレージやキッチンでバイオロジーを行うムーブメント、バイオパンク、DIYbio を体験しておきたいというのもありますし、Arduino などオープンハードウェア、Maker のムーブメントを体験するのも目的の一つです。ハードウェア開発が思っているほどハードルが下っていることを体験できて、かつ、将来、ウェットの開発だけでなく、装置開発などもできたら、ラッキー、ぐらいの気持ちでやってみました。   購入 今回作ったのは、組み立て式で、かつ、仕様などや設計図が公開されているOpenPCRというサーマルサイクラーです。ハードウェアの仕様・設計図、制御ソフトウェアなどの情報がすべて公開されており、部品からも自作することが可能です。今回は、「設計図から部品や回路のパーツを作り、それらを組み立てる直前のもの」を購入しました。   ChaiBio https://www.chaibio.com/   OpenPCR https://www.chaibio.com/products/openpcr   なぜか http://openpcr.org/  で購入できなかったので、eBay にある ChaiBio で買いました。   OpenPCR - eBay http://www.ebay.com/itm/111096418574   本体価格は

大学の研究室でアカデミックプランが使えるICTツール

自分らでサーバ管理したくないので、SaaS系とローカルで動くソフトのみ。ローカルで動くソフトに関しては、Mac or Docker で動くもののみ。 無償 G Suite for Education  (ドキュメント共有、カレンダーなど) GitHub Education  (ソースコード管理) esa.io アカデミックプラン  (知識共有) Tableau  (データ可視化) Scrapbox  (知識共有) GROWI.cloud  (Wikiなど) 割引 Slack の教育支援プログラム  (ビジネスチャット) Dropbox Education  (ファイル共有、ドキュメント共有) Office 356  (オフィスソフト) Adobe Creative Cloud  (画像編集) AutoDesk for Education  (CADなど) これから申し込んでいくところなので、本当に使えるかはわかりせん。使えた使えないなどの情報やほかのツールでお勧めがあれば教えてもらえると嬉しいです。 アカデミアでなくても無料で使えるツールのうち、うちで使うであろうものは以下に列挙していく。 Google Colaboratory  (データ解析) Overleaf  (論文執筆) Rstudio  (開発, データ解析) VS code (開発)