liuhuanyong
commited on
Update README.md
Browse files
README.md
CHANGED
@@ -20,7 +20,20 @@ pipeline_tag: object-detection
|
|
20 |
|
21 |
因此,为了解决这一问题,我们通过人工标注的方式对论文文档进行细粒度标签改造以及数据优化,并构建起研报场景细粒度版式分析数据集,最好利用这些标注数据集,训练了多个全新的中文文档版式分析模型,在**封闭测试集上表现优异**。
|
22 |
|
23 |
-
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
24 |
|
25 |
## 二、使用
|
26 |
|
|
|
20 |
|
21 |
因此,为了解决这一问题,我们通过人工标注的方式对论文文档进行细粒度标签改造以及数据优化,并构建起研报场景细粒度版式分析数据集,最好利用这些标注数据集,训练了多个全新的中文文档版式分析模型,在**封闭测试集上表现优异**。
|
22 |
|
23 |
+
2024-06-15,我们优先开源了面向**论文**和**研报**两个场景的版面分析轻量化模型权重及相应的标签体系,旨在能够识别文档中的段落边界等信息,并准确区分文本、图像、表格、公式等其他元素,最终推动产业发展。
|
24 |
+
|
25 |
+
2024-06-28,新增**英文论文场景、通用场景**两个新版式分析模型,开源版式分析模型达到4个。
|
26 |
+
|
27 |
+
主要特点:
|
28 |
+
|
29 |
+
1)涵盖中文论文、英文论文、中文研报三个垂直领域及1个通用场景模型;
|
30 |
+
|
31 |
+
2)轻量化推理快速【基于yolov8训练,单模型6.23MB】;
|
32 |
+
|
33 |
+
3)中文论文场景包含段落信息【CLDA不具备段落信息,我们开源独有】;
|
34 |
+
|
35 |
+
4)中文研报场景/通用场景【基于数万级别高质量数据训练,我们开源独有】
|
36 |
+
|
37 |
|
38 |
## 二、使用
|
39 |
|