文章详情
9.1 视觉语言模型微调 LLaMA-Factory支持LLaVA风格的视觉语言模型微调。 数据格式 配置 9.2 图文数据准备 数据量建议: - 场景识别:5000-10000对 - OCR:10000+对 - 图表理解:3000-5000对 - 医学影像:需要领域专家标注 数据质量要求: - 图片分辨率不要太低(至少224x224) - 描述要准确具体,
3 阅读
请输入邀请码解锁全文内容