中文多模态预训练模型
- 2021 | WenLan: Bridging Vision and Language by Large-Scale Multi-Modal Pre-Training | Yuqi Huo, et al. | arXiv |
PDF
| 模型 | 版本 | 介绍 | 模型下载 | 作者 | 源地址 | 应用领域 | 备注 |
|---|---|---|---|---|---|---|---|
| BriVL(WenLan) | 10亿参数 | 项目首页 | 模型下载 | BAAI-WuDao | github | 中文通用图文 | 需要登陆才能下载 |
- 2021 | CogView: Mastering Text-to-Image Generation via Transformers | Ming Ding, et al. | arXiv |
PDF
| 模型 | 版本 | 介绍 | 模型下载 | 作者 | 源地址 | 应用领域 | 备注 |
|---|---|---|---|---|---|---|---|
| CogView | 40亿参数 | 项目首页 | 模型下载 | THUDM | github | 中文多模态生成模型 | 需要登陆才能下载 |
| 模型 | 版本 | 介绍 | 模型下载 | 作者 | 源地址 | 应用领域 | 备注 |
|---|---|---|---|---|---|---|---|
| 紫东太初- light_vision_text | 项目首页 | 模型下载 | 中科院自动化所 | github | 中文图像-文本领域 | 紫东太初多模态大模型中的图像-文本预训练模型 | |
| 紫东太初-text[GPT] | 32亿参数 | 项目首页 | 百度网盘-nos5 | 中科院自动化所 | github | 中文通用 | 紫东太初多模态大模型中的文本预训练模型 |
| 紫东太初-vision | 项目首页 | 模型下载 | 中科院自动化所 | github | 视觉领域 | 紫东太初多模态大模型中的视觉预训练模型 | |
| 紫东太初-speech | 项目首页 | 模型下载 | 中科院自动化所 | github | 语音领域 | 紫东太初多模态大模型中的语音检测与识别多任务模型 |
- 2021 | Mengzi: Towards Lightweight yet Ingenious Pre-trained Models for Chinese | Zhuosheng Zhang, et al. | arXiv |
PDF
| 模型 | 版本 | TensorFlow | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|
| Mengzi-oscar | base(L12) | [🤗HF] | Langboat | github | 中文多模态-图文 |
- 2022 | Zero and R2D2: A Large-scale Chinese Cross-modal Benchmark and A Vision-Language Framework | Chunyu Xie, et al. | arXiv |
PDF
| 模型 | 版本 | TensorFlow | PyTorch | 作者 | 源地址 | 首页 | 应用领域 |
|---|---|---|---|---|---|---|---|
| R2D2ViT-L | large | yuxie11 | github | zero | 中文多模态-图文 | ||
| PRD2ViT-L | large | yuxie11 | github | zero | 中文多模态-图文 |
- 2021 | Learning Transferable Visual Models From Natural Language Supervision | Alec Radford, et al. | arXiv |
PDF - 2022 | Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese | An Yang, et al. | arXiv |
PDF
| 模型 | 版本 | TensorFlow | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|
| CN-CLIPRN50 | 77M | aliyuncs | OFA-Sys | github | 中文多模态-图文 | |
| CN-CLIPViT-B/16 | 188M | aliyuncs | OFA-Sys | github | 中文多模态-图文 | |
| CN-CLIPViT-L/14 | 406M | aliyuncs | OFA-Sys | github | 中文多模态-图文 | |
| CN-CLIPViT-L/14@336px | 407M | aliyuncs | OFA-Sys | github | 中文多模态-图文 | |
| CN-CLIPViT-H/14 | 958M | aliyuncs | OFA-Sys | github | 中文多模态-图文 |
- 2021 | Learning Transferable Visual Models From Natural Language Supervision | Alec Radford, et al. | arXiv |
PDF - 2022 | Fengshenbang 1.0: Being the Foundation of Chinese Cognitive Intelligence | Junjie Wang, et al. | arXiv |
PDF
| 模型 | 版本 | TensorFlow | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|
| Taiyi-CLIP-Roberta-large-326M-Chinese | base | [🤗HF] | IDEA-CCNL | github | 中文多模态-图文 |
- 2022 | AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities | Chen, Zhongzhi, et al. | arXiv |
PDF
| 模型 | 版本 | TensorFlow | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|
| AltCLIP | 3.22G | [🤗HF] | FlagAI | github | 中文多模态-图文 |
- 2022 | AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities | Chen, Zhongzhi, et al. | arXiv |
PDF - 2022 | High-Resolution Image Synthesis With Latent Diffusion Models | Rombach, et al. | arXiv |
PDF
| 模型 | 版本 | TensorFlow | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|
| AltDiffusion | 8.0G | [🤗HF] | FlagAI | github | 中文多模态-图文 |
- 2022 | Fengshenbang 1.0: Being the Foundation of Chinese Cognitive Intelligence | Junjie Wang, et al. | arXiv |
PDF - 2022 | High-Resolution Image Synthesis With Latent Diffusion Models | Rombach, et al. | arXiv |
PDF
| 模型 | 版本 | TensorFlow | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|
| Taiyi-Stable-Diffusion | 1B | [🤗HF] | IDEA-CCNL | github | 中文多模态-图文 |
- 2022 | Wukong: A 100 Million Large-scale Chinese Cross-modal Pre-training Benchmark | Jiaxi Gu, et al. | arXiv |
PDF
| 模型 | 版本 | TensorFlow | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|
| CLIP | url | HUAWEI | github | 中文多模态-图文 | ||
| FILIP | url | HUAWEI | github | 中文多模态-图文 | ||
| wukong | url | HUAWEI | github | 中文多模态-图文 |
- 2022 | OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework | Peng Wang, et al. | arXiv |
PDF
| 模型 | 版本 | TensorFlow | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|
| OFA | link | OFA-Sys | github | 中文多模态-图文 | ||
| OFA-Chinese | [🤗HF] | Yang JianXin | github | 中文多模态-图文 |
| 模型 | 版本 | 视觉架构 | PyTorch | 作者 | 源地址 | 应用领域 |
|---|---|---|---|---|---|---|
| QA-CLIPRN50 | 77M | ResNet50 | [🤗HF] | 腾讯 | QA-CLIP | 中文多模态-图文 |
| QA-CLIPViT-B/16 | 188M | ViT-B/16 | [🤗HF] | 腾讯 | QA-CLIP | 中文多模态-图文 |
| QA-CLIPViT-L/14 | 406M | ViT-L/14 | [🤗HF] | 腾讯 | QA-CLIP | 中文多模态-图文 |