mnaguib commited on
Commit
e6bce60
·
verified ·
1 Parent(s): 6ce8aa2

No synthetic data, 15 epochs

Browse files
Files changed (2) hide show
  1. README.md +74 -80
  2. model.safetensors +1 -1
README.md CHANGED
@@ -4,43 +4,43 @@ tags:
4
  - sentence-similarity
5
  - feature-extraction
6
  - generated_from_trainer
7
- - dataset_size:8000
8
  - loss:CosineSimilarityLoss
9
  base_model: dangvantuan/sentence-camembert-large
10
  widget:
11
- - source_sentence: L’examen physique révélait une légère sensibilité de la fosse lombaire
12
- droite.
13
  sentences:
14
- - En octobre 2003, la patiente était en excellent état général.
15
- - Le bilan biologique a montré une anémie à 7,1g/dl d’hémoglobine.
16
- - L’examen O.R.L. retrouvait une légère surdité de perception.
17
- - source_sentence: Il n’y avait pas d’écoulement urétral.
 
18
  sentences:
19
- - L'examen tomodensitométrique objectivait un épaississement diffus et suspect de
20
- la paroi vésicale avec une plage tissulaire de 3 cm en regard de la face postéro
21
- latérale droite.
22
- - Les suites postopératoires ont été satisfaisantes.
23
- - A l'entrée le score de Glasgow est à 15.
24
- - source_sentence: L’évolution était favorable avec un recul de 2 ans.
25
  sentences:
26
- - Les suites postopératoires furent simples.
27
- - Ces aspects histologiques et immunohistochimiques permettaient d'évoquer le diagnostic
28
- de tumeur fibreuse solitaire rétropéritonéale.
29
- - Une néphrectomie polaire inférieure a été réalisée.
30
- - source_sentence: Le bilan dhémostase était sans anomalie.
 
 
31
  sentences:
32
- - La tomodensitométrie abdominale confirmait la présence d’une masse kystique rétropéritonéale
33
- d’une densité de 13 UH et mesurant 17 cm x 11,5 cm (Figure 2).
34
- - La radiographie de l’abdomen sans préparation a révélé l’existence d’une calcification
35
- pararachidienne droite à la hauteur de L2.
36
- - Les suites opératoires immédiates ont été simples.
37
- - source_sentence: La fonction rénale globale a été évaluée dans les limites de la
38
- normale.
39
  sentences:
40
- - L'urée sérique est de 0,51 g/l et la créatinine de 9,2 mg/l.
41
- - L’indication de césarienne fut posée en urgence.
42
- - L’échographie de l’appareil urinaire confirme la présence de deux reins et d’une
43
- vessie sans particularité.
44
  pipeline_tag: sentence-similarity
45
  library_name: sentence-transformers
46
  metrics:
@@ -57,10 +57,10 @@ model-index:
57
  type: sts-dev
58
  metrics:
59
  - type: pearson_cosine
60
- value: 0.5280598621610098
61
  name: Pearson Cosine
62
  - type: spearman_cosine
63
- value: 0.49230380675950897
64
  name: Spearman Cosine
65
  ---
66
 
@@ -113,9 +113,9 @@ from sentence_transformers import SentenceTransformer
113
  model = SentenceTransformer("sentence_transformers_model_id")
114
  # Run inference
115
  sentences = [
116
- 'La fonction rénale globale a été évaluée dans les limites de la normale.',
117
- "L'urée sérique est de 0,51 g/l et la créatinine de 9,2 mg/l.",
118
- 'L’échographie de l’appareil urinaire confirme la présence de deux reins et d’une vessie sans particularité.',
119
  ]
120
  embeddings = model.encode(sentences)
121
  print(embeddings.shape)
@@ -160,10 +160,10 @@ You can finetune this model on your own dataset.
160
  * Dataset: `sts-dev`
161
  * Evaluated with [<code>EmbeddingSimilarityEvaluator</code>](https://sbert.net/docs/package_reference/sentence_transformer/evaluation.html#sentence_transformers.evaluation.EmbeddingSimilarityEvaluator)
162
 
163
- | Metric | Value |
164
- |:--------------------|:-----------|
165
- | pearson_cosine | 0.5281 |
166
- | **spearman_cosine** | **0.4923** |
167
 
168
  <!--
169
  ## Bias, Risks and Limitations
@@ -183,19 +183,19 @@ You can finetune this model on your own dataset.
183
 
184
  #### Unnamed Dataset
185
 
186
- * Size: 8,000 training samples
187
  * Columns: <code>sentence1</code>, <code>sentence2</code>, and <code>score</code>
188
- * Approximate statistics based on the first 1000 samples:
189
- | | sentence1 | sentence2 | score |
190
- |:--------|:---------------------------------------------------------------------------------|:---------------------------------------------------------------------------------|:---------------------------------------------------------------|
191
- | type | string | string | float |
192
- | details | <ul><li>min: 8 tokens</li><li>mean: 23.2 tokens</li><li>max: 97 tokens</li></ul> | <ul><li>min: 7 tokens</li><li>mean: 22.9 tokens</li><li>max: 90 tokens</li></ul> | <ul><li>min: 0.0</li><li>mean: 0.18</li><li>max: 0.8</li></ul> |
193
  * Samples:
194
- | sentence1 | sentence2 | score |
195
- |:----------------------------------------------------------------------------------------|:-------------------------------------------------------------------------------------------------------------------------------------------------------------------|:-----------------|
196
- | <code>Il n'y avait pas de résidu post-mictionnel.</code> | <code>Le traumatisme, majoré par son habitat éloigné des centres de soins, avait entrainé une perturbation importante de sa vie familiale (enfants jeunes).</code> | <code>0.0</code> |
197
- | <code>Les suites opératoires sont simples.</code> | <code>La pyélographie descendante, réalisée au 6ème jour au bloc opératoire, a montré une dilatation pyélo-urétérale majeure (Figure 2).</code> | <code>0.0</code> |
198
- | <code>Il a nécessité 7 poches dirrigation pour un temps opératoire d’une heure.</code> | <code>Le reste de l'examen est sans particularités.</code> | <code>0.0</code> |
199
  * Loss: [<code>CosineSimilarityLoss</code>](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#cosinesimilarityloss) with these parameters:
200
  ```json
201
  {
@@ -207,19 +207,19 @@ You can finetune this model on your own dataset.
207
 
208
  #### Unnamed Dataset
209
 
210
- * Size: 2,000 evaluation samples
211
  * Columns: <code>sentence1</code>, <code>sentence2</code>, and <code>score</code>
212
- * Approximate statistics based on the first 1000 samples:
213
- | | sentence1 | sentence2 | score |
214
- |:--------|:----------------------------------------------------------------------------------|:---------------------------------------------------------------------------------|:---------------------------------------------------------------|
215
- | type | string | string | float |
216
- | details | <ul><li>min: 7 tokens</li><li>mean: 23.25 tokens</li><li>max: 97 tokens</li></ul> | <ul><li>min: 7 tokens</li><li>mean: 23.5 tokens</li><li>max: 97 tokens</li></ul> | <ul><li>min: 0.0</li><li>mean: 0.17</li><li>max: 0.8</li></ul> |
217
  * Samples:
218
- | sentence1 | sentence2 | score |
219
- |:-------------------------------------------------------------------------------------------------------------------------------------------------|:----------------------------------------------------------------------------------------------------------|:-----------------|
220
- | <code>Les suites post-opératoires ont été simples, permettant dôter le drain aspiratif à J 2.</code> | <code>Les suites post-opératoires ont été simples, permettant d’ôter le drain aspiratif à J 2.</code> | <code>0.5</code> |
221
- | <code>Un traitement par isoniazide (300mg/24h) et rifampicine (600 mg/24h) était immédiatement débuté, associé à la prise de paracétamol.</code> | <code>Lors de l’exploration, est trouvée une masse kystique développée aux dépens de la surrénale.</code> | <code>0.0</code> |
222
- | <code>Le patient a été opéré.</code> | <code>L'examen clinique a trouvé un malade en bon état général.</code> | <code>0.0</code> |
223
  * Loss: [<code>CosineSimilarityLoss</code>](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#cosinesimilarityloss) with these parameters:
224
  ```json
225
  {
@@ -231,10 +231,10 @@ You can finetune this model on your own dataset.
231
  #### Non-Default Hyperparameters
232
 
233
  - `eval_strategy`: steps
234
- - `per_device_train_batch_size`: 64
235
  - `per_device_eval_batch_size`: 16
236
- - `learning_rate`: 2e-05
237
- - `num_train_epochs`: 10
238
  - `warmup_ratio`: 0.1
239
  - `fp16`: True
240
 
@@ -245,20 +245,20 @@ You can finetune this model on your own dataset.
245
  - `do_predict`: False
246
  - `eval_strategy`: steps
247
  - `prediction_loss_only`: True
248
- - `per_device_train_batch_size`: 64
249
  - `per_device_eval_batch_size`: 16
250
  - `per_gpu_train_batch_size`: None
251
  - `per_gpu_eval_batch_size`: None
252
  - `gradient_accumulation_steps`: 1
253
  - `eval_accumulation_steps`: None
254
  - `torch_empty_cache_steps`: None
255
- - `learning_rate`: 2e-05
256
  - `weight_decay`: 0.0
257
  - `adam_beta1`: 0.9
258
  - `adam_beta2`: 0.999
259
  - `adam_epsilon`: 1e-08
260
  - `max_grad_norm`: 1.0
261
- - `num_train_epochs`: 10
262
  - `max_steps`: -1
263
  - `lr_scheduler_type`: linear
264
  - `lr_scheduler_kwargs`: {}
@@ -360,20 +360,14 @@ You can finetune this model on your own dataset.
360
  </details>
361
 
362
  ### Training Logs
363
- | Epoch | Step | Training Loss | Validation Loss | sts-dev_spearman_cosine |
364
- |:------:|:----:|:-------------:|:---------------:|:-----------------------:|
365
- | 0.7937 | 50 | - | 0.0528 | 0.4275 |
366
- | 1.5873 | 100 | - | 0.0470 | 0.4887 |
367
- | 2.3810 | 150 | - | 0.0460 | 0.4884 |
368
- | 3.1746 | 200 | - | 0.0439 | 0.5076 |
369
- | 3.9683 | 250 | - | 0.0440 | 0.5078 |
370
- | 4.7619 | 300 | - | 0.0439 | 0.5236 |
371
- | 5.5556 | 350 | - | 0.0440 | 0.5059 |
372
- | 6.3492 | 400 | - | 0.0437 | 0.5080 |
373
- | 7.1429 | 450 | - | 0.0444 | 0.4989 |
374
- | 7.9365 | 500 | 0.0283 | 0.0441 | 0.4999 |
375
- | 8.7302 | 550 | - | 0.0443 | 0.4977 |
376
- | 9.5238 | 600 | - | 0.0447 | 0.4923 |
377
 
378
 
379
  ### Framework Versions
 
4
  - sentence-similarity
5
  - feature-extraction
6
  - generated_from_trainer
7
+ - dataset_size:800
8
  - loss:CosineSimilarityLoss
9
  base_model: dangvantuan/sentence-camembert-large
10
  widget:
11
+ - source_sentence: Le toucher rectal est normal.
 
12
  sentences:
13
+ - Devant la réticence initiale, une symptomatologie délirante est suspectée, mais
14
+ elle ne sera jamais verbalisée par la patiente.
15
+ - Le toucher vaginal était normal.
16
+ - 'Sur le plan biologique , ce patient présente à l''admission :'
17
+ - source_sentence: Une résection endoscopique de la tumeur a été réalisée.
18
  sentences:
19
+ - Une mise à plat avec ligature de l’artère hypogastrique a été réalisée.
20
+ - La figure 1 présente la chronologie des événements et de la prise des médicaments.
21
+ - L'ECBU était stérile.
22
+ - source_sentence: La quadrithérapie est poursuivie douze jours sans qu’aucune amélioration
23
+ clinique ou biologique ne soit entrevue.
 
24
  sentences:
25
+ - Un double abord abdominal et périnéal permit de réaliser une uréthro-cystectomie
26
+ avec colpohystérectomie suivie d’une poche iléocaecale continente périombilicale.
27
+ - Aucune récidive tumorale n’a été retrouvée par cytologie urinaire, urétéro-pyélographie
28
+ rétrograde et urétéroscopie souple.
29
+ - La patiente ne fume pas, ne prend que très rarement de lalcool et n’a pas d’allergie
30
+ aux médicaments.
31
+ - source_sentence: La cystographie se révéla normale.
32
  sentences:
33
+ - La cystographie rétrograde était normale.
34
+ - Le reste de l’urètre était normal.
35
+ - L’examen anatomo-pathologique conclut à un carcinome indifférencié, de stade pT
36
+ 1 grade 3.
37
+ - source_sentence: Le patient a été mis sous antibiothérapie adaptée (pénicilline
38
+ A + aminoside).
 
39
  sentences:
40
+ - Les prélèvements de sang et d'urine sont effectués 10 heures plus tard.
41
+ - En octobre 2003, la patiente était en excellent état général.
42
+ - L’étude anatomopathologique de la biopsie était en faveur d’un adénocarcinome
43
+ à cellules claires.
44
  pipeline_tag: sentence-similarity
45
  library_name: sentence-transformers
46
  metrics:
 
57
  type: sts-dev
58
  metrics:
59
  - type: pearson_cosine
60
+ value: 0.9436084075678098
61
  name: Pearson Cosine
62
  - type: spearman_cosine
63
+ value: 0.9430494182630849
64
  name: Spearman Cosine
65
  ---
66
 
 
113
  model = SentenceTransformer("sentence_transformers_model_id")
114
  # Run inference
115
  sentences = [
116
+ 'Le patient a été mis sous antibiothérapie adaptée (pénicilline A + aminoside).',
117
+ 'En octobre 2003, la patiente était en excellent état général.',
118
+ "Les prélèvements de sang et d'urine sont effectués 10 heures plus tard.",
119
  ]
120
  embeddings = model.encode(sentences)
121
  print(embeddings.shape)
 
160
  * Dataset: `sts-dev`
161
  * Evaluated with [<code>EmbeddingSimilarityEvaluator</code>](https://sbert.net/docs/package_reference/sentence_transformer/evaluation.html#sentence_transformers.evaluation.EmbeddingSimilarityEvaluator)
162
 
163
+ | Metric | Value |
164
+ |:--------------------|:----------|
165
+ | pearson_cosine | 0.9436 |
166
+ | **spearman_cosine** | **0.943** |
167
 
168
  <!--
169
  ## Bias, Risks and Limitations
 
183
 
184
  #### Unnamed Dataset
185
 
186
+ * Size: 800 training samples
187
  * Columns: <code>sentence1</code>, <code>sentence2</code>, and <code>score</code>
188
+ * Approximate statistics based on the first 800 samples:
189
+ | | sentence1 | sentence2 | score |
190
+ |:--------|:---------------------------------------------------------------------------------|:----------------------------------------------------------------------------------|:---------------------------------------------------------------|
191
+ | type | string | string | float |
192
+ | details | <ul><li>min: 8 tokens</li><li>mean: 23.6 tokens</li><li>max: 97 tokens</li></ul> | <ul><li>min: 7 tokens</li><li>mean: 23.23 tokens</li><li>max: 90 tokens</li></ul> | <ul><li>min: 0.0</li><li>mean: 0.42</li><li>max: 1.0</li></ul> |
193
  * Samples:
194
+ | sentence1 | sentence2 | score |
195
+ |:---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|:-------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|:-----------------|
196
+ | <code>L'UIV a objectivé un retard de sécrétion avec importante dilatation pyélo-calicielle et de l'uretère lombaire en amont d'un énorme calcul de l'uretère iliaque et pelvien droit (Figure 2).</code> | <code>L'UIV a montré une importante dilatation urétéro-pyélo-calicielle en amont d'un énorme calcul de l'uretère gauche, le coté droit était sans anomalies (Figure 6).</code> | <code>0.6</code> |
197
+ | <code>1 Diminution méthadone à 80 mg TID.</code> | <code>7 Diminution méthadone à 20 mg TID</code> | <code>0.6</code> |
198
+ | <code>L’examen clinique à lentrée trouvait au toucher rectal une grosse vésicule séminale droite.</code> | <code>L'examen clinique trouvait au toucher rectal un plancher vésical fixé à gauche.</code> | <code>0.6</code> |
199
  * Loss: [<code>CosineSimilarityLoss</code>](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#cosinesimilarityloss) with these parameters:
200
  ```json
201
  {
 
207
 
208
  #### Unnamed Dataset
209
 
210
+ * Size: 400 evaluation samples
211
  * Columns: <code>sentence1</code>, <code>sentence2</code>, and <code>score</code>
212
+ * Approximate statistics based on the first 400 samples:
213
+ | | sentence1 | sentence2 | score |
214
+ |:--------|:----------------------------------------------------------------------------------|:----------------------------------------------------------------------------------|:---------------------------------------------------------------|
215
+ | type | string | string | float |
216
+ | details | <ul><li>min: 8 tokens</li><li>mean: 23.05 tokens</li><li>max: 97 tokens</li></ul> | <ul><li>min: 7 tokens</li><li>mean: 22.45 tokens</li><li>max: 88 tokens</li></ul> | <ul><li>min: 0.0</li><li>mean: 0.45</li><li>max: 1.0</li></ul> |
217
  * Samples:
218
+ | sentence1 | sentence2 | score |
219
+ |:---------------------------------------------------------|:-------------------------------------------------------------------|:-----------------|
220
+ | <code>Lexamen clinique était sans particularité.</code> | <code>La formule sanguine était sans particularité.</code> | <code>0.4</code> |
221
+ | <code>Le bilan biologique était correct.</code> | <code>Le geste était complet.</code> | <code>0.0</code> |
222
+ | <code>La sérologie VIH était négative.</code> | <code>La cytologie urinaire pyélique droite était négative.</code> | <code>0.2</code> |
223
  * Loss: [<code>CosineSimilarityLoss</code>](https://sbert.net/docs/package_reference/sentence_transformer/losses.html#cosinesimilarityloss) with these parameters:
224
  ```json
225
  {
 
231
  #### Non-Default Hyperparameters
232
 
233
  - `eval_strategy`: steps
234
+ - `per_device_train_batch_size`: 128
235
  - `per_device_eval_batch_size`: 16
236
+ - `learning_rate`: 1e-05
237
+ - `num_train_epochs`: 15
238
  - `warmup_ratio`: 0.1
239
  - `fp16`: True
240
 
 
245
  - `do_predict`: False
246
  - `eval_strategy`: steps
247
  - `prediction_loss_only`: True
248
+ - `per_device_train_batch_size`: 128
249
  - `per_device_eval_batch_size`: 16
250
  - `per_gpu_train_batch_size`: None
251
  - `per_gpu_eval_batch_size`: None
252
  - `gradient_accumulation_steps`: 1
253
  - `eval_accumulation_steps`: None
254
  - `torch_empty_cache_steps`: None
255
+ - `learning_rate`: 1e-05
256
  - `weight_decay`: 0.0
257
  - `adam_beta1`: 0.9
258
  - `adam_beta2`: 0.999
259
  - `adam_epsilon`: 1e-08
260
  - `max_grad_norm`: 1.0
261
+ - `num_train_epochs`: 15
262
  - `max_steps`: -1
263
  - `lr_scheduler_type`: linear
264
  - `lr_scheduler_kwargs`: {}
 
360
  </details>
361
 
362
  ### Training Logs
363
+ | Epoch | Step | Validation Loss | sts-dev_spearman_cosine |
364
+ |:-----:|:----:|:---------------:|:-----------------------:|
365
+ | 2.5 | 10 | 0.0233 | 0.9013 |
366
+ | 5.0 | 20 | 0.0180 | 0.9274 |
367
+ | 7.5 | 30 | 0.0163 | 0.9364 |
368
+ | 10.0 | 40 | 0.0150 | 0.9407 |
369
+ | 12.5 | 50 | 0.0145 | 0.9425 |
370
+ | 15.0 | 60 | 0.0144 | 0.9430 |
 
 
 
 
 
 
371
 
372
 
373
  ### Framework Versions
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c29670663192bc7f700e0bbf58dfac435ad2bfceeb76cfcb66154f257efe00dd
3
  size 1346690896
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e3937a9708a3047e40ff754a0173ff6f4c50e35f54c4ed1236a235d5eaf25a37
3
  size 1346690896