先把环境跑通,再谈分析
PsyBit 想做成心理学专业的统计方法教程站——统计是心理学研究的基本功,生物信息这类方法先作为拓展模块落地。材料给同门自学用:从 Linux 命令行、Python、R 和 conda 环境管理打底,到分子对接与虚拟筛选,再到 RNA-seq 组学分析,每个模块都配一个能真正跑起来的案例。不追求把知识讲全,追求你照着做能出结果。
三步上手
-
装好地基(半天到一周)
把 conda 环境管理、Python、R 装通,命令行能熟练跑起来。这一步跳过,后面每个工具都会卡你一次。
-
跑通一个真实案例(一到两天)
拿伊马替尼对接回 c-Abl(PDB: 1IEP)做第一个案例——输入从哪来、命令怎么敲、结果怎么判断,全流程走一遍。跑通一个,同类流程就都会了。
-
换到自己的课题上
把示例里的受体、配体、参考文件、分组名换成你自己的,按模块里的「必改项」逐条改。做不通先看报错,再对照常见坑清单。
五个模块
地基篇:Linux · Python · R · 环境管理
命令行必备命令、Python 与 Biopython 上手顺序、R 与 Bioconductor 生态、conda 环境隔离。附 4 周推进表和一条检验标准。
分子对接与虚拟筛选
原理最小集、AutoDock Vina 官方示例、受体与配体准备、批量筛选脚本、MM-GBSA 与 MD 后处理路径、结果可视化。
生信组学分析
数据格式与公共数据库、序列分析、RNA-seq 完整链条(fastp → HISAT2 → featureCounts → DESeq2 → clusterProfiler)、单细胞与表观入门。
项目实战:一次真实的虚拟筛选课题
一个真实课题的脱敏复盘:七步链路,以及每一步实际踩过的坑——数据泄漏、划分口径、特征标准化、对接的定位。
资源总索引
GitHub 优质仓库、官方文档、学习平台、常用公共数据库,共 40 余条,逐条实际访问验证过,打不开的已经剔除并写明原因。
工具与环境安装
R、Python、conda 的官方下载地址与安装步骤,环境检查命令,编辑器选择,以及装依赖时最常遇到的几类报错怎么处理。
学习路径参考
两条主线可以并行,也可以先走一条。都不必追求把理论学完再动手——边做边补是最快的方式。
| 周次 | 主线 A:分子对接 | 主线 B:组学分析 |
|---|---|---|
| 第 0–1 周 | 装好 conda 环境,跑通 1IEP 对接案例,拿到第一个打分 | 装好环境,认识 FASTQ / FASTA / GTF 等格式,跑通一条小 RNA-seq |
| 第 2 周 | 学会准备自己的受体与配体(加氢、质子化态、盒子) | R 基础与绘图,能用 DESeq2 读出差异表 |
| 第 3 周 | 做一次小规模虚拟筛选,拿到排序表并判断可信度 | 序列分析(比对、进化树),理解比对参数 |
| 第 4 周 | 往后处理走:挑候选做 MM-GBSA 或短 MD | RNA-seq 全链完整跑一遍,出富集结果 |
| 第 5–8 周 | 结合自己的课题,把筛选结果落到可解释的候选上 | 单细胞、表观或变异检测里选一个分支深入,最后做一个小项目 |
每条主线的详细周计划写在对应模块页里,这里只给个整体节奏。
这套材料的三条底线
- 内容是真资源。引用的教程、代码、案例都来自 GitHub 或官方文档,不是生成的注水内容;每条外链实际访问过,打不开的直接剔除并写明原因。
- 代码是真跑过的。站点收录的脚本都在真实环境里跑过一遍,验证的环境、命令、输出与踩坑记录在代码验证报告里全部公开;还没跑完的部分如实标注状态,不提前打勾。
- 案例是真案例。核心案例(1IEP 对接、RNA-seq 全链、虚拟筛选复盘)都来自真实课题或官方示例,脱敏后完整呈现方法链路。
别一上来就找「一键出结果」的工具。生信工具绝大多数是命令行程序,流程必然涉及批量文件处理——命令行加管道是唯一高效的做法。先把地基层过一遍,后面省下的时间远超这两周。
教程站 · 面向同门自学 · 持续更新。内容按模块组织,右侧导航可直达各章;顶部搜索框(Ctrl / Cmd + K)可以检索全站正文。