Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
7 changes: 7 additions & 0 deletions .gitattributes
Original file line number Diff line number Diff line change
Expand Up @@ -122,6 +122,13 @@ MyIA.AI.Notebooks/SymbolicAI/Argument_Analysis/data/argumentum_*_taxonomy.csv -t
# l'EPIC #10355) : il est en CRLF pur, mais sans `-text` le blob stocke serait
# normalise en LF sous `core.autocrlf=true` et differerait de l'amont.
MyIA.AI.Notebooks/GenAI/FallacyDetection/data/argumentum_scenarii_cards.csv -text
# Tranche C de l'EPIC #10355 (issue #17578) : corpus academique MAFALDA,
# recopie octet pour octet depuis ChadiHelwe/MAFALDA. Les `.jsonl` amont sont
# en LF purs ; sans `-text`, la normalisation CRLF sur une machine
# `core.autocrlf=true` pourrait reecrire le blob stocke et la copie
# cesserait d'etre verbatim. Preuve de verbatim : egalite des SHA de blob,
# consignee dans NOTICE-MAFALDA et manifest.json.
MyIA.AI.Notebooks/GenAI/FallacyDetection/data/academic/MAFALDA/*.jsonl -text


# Meme raisonnement pour les ontologies OWL distillees depuis le meme amont, et
Expand Down
Original file line number Diff line number Diff line change
@@ -0,0 +1,66 @@
NOTICE — CoursIA `data/academic/LOGIC/` (espace négatif : RIEN n'est committé ici)
==============================================================================

Ce répertoire ne contient AUCUN fichier du corpus LOGIC — volontairement, et
ce NOTICE documente pourquoi ainsi que la voie conforme pour le consommer
(tranche C de l'issue #17578, EPIC #10355 — critère 2 de c.6073752732).

Corpus : LOGIC (Jin et al. 2022, « Logical Fallacy Detection »,
arXiv:2202.13758)
Dépôt source : https://github.com/causalNLP/logical-fallacy
Commit épinglé : 2a3d09708122c0994279df034d867b80950700ea (HEAD amont à
l'épinglage, 2026-10-10)

Pourquoi aucune copie verbatim
------------------------------

Mesuré firsthand le 2026-10-10 par la lane po-2025 (converge avec la mesure
po-2026 du 2026-10-09, c.6073752732) :

- champ `license` de l'API GitHub : **null** ;
- aucun fichier `LICENSE` dans l'arbre du commit épinglé ;
- aucune mention de licence dans le README (2 855 octets).

Les mentions « MIT © 2022 Zhijing Jin » trouvées en ligne sont des
attestations TIERS (repo aval `lfx`), invérifiables contre le dépôt source :
elles ne fondent pas un droit de redistribution. CoursIA étant un dépôt
public, committer le corpus verbatim exigerait des droits établis, pas
supposés — la copie reste donc hors dépôt.

**Interdit de fait** : ne JAMAIS committer les CSV LOGIC dans ce dépôt tant
que la licence n'est pas éclaircie à la source (au besoin : issue upstream
demandant l'éclaircissement aux auteurs, puis re-mesure).

Voie conforme — fetch déterministe épinglé (critère 2, voie (b))
----------------------------------------------------------------

Les consommateurs (alignement taxonomique, constructeurs) téléchargent à
l'exécution depuis

https://raw.githubusercontent.com/causalNLP/logical-fallacy/<commit>/data/<fichier>

avec `<commit>` = le commit épinglé ci-dessus, puis VÉRIFIENT l'empreinte du
fichier téléchargé contre `manifest.json` (SHA-256) avant toute consommation.
Le manifeste porte, pour chacun des 12 fichiers de `data/` au commit épinglé :
blob SHA1 (haché sans filtre de conversion), SHA-256, taille — les deux
premiers égaux à l'arbre amont au moment de l'épinglage.

Alternative : lecture via chemin hors-dépôt (GDrive privé, comme les
pipelines de notation), la voie (a) du critère 2.

Particularité d'empreinte
-------------------------

Deux fichiers amont contiennent des CRLF dans leur blob stocké
(`edu_test.csv` : 2, `mappings.csv` : 14) ; les dix autres sont en LF purs.
Un `git hash-object` sous `core.autocrlf=true` NORMALISE silencieusement ces
CRLF et rend un SHA différent de l'amont — les empreintes du manifeste sont
calculées en mode brut (`--no-filters`). Toute re-vérification locale doit
faire de même.

Resynchronisation
-----------------

Re-mesurer le HEAD amont, re-télécharger, re-empendre en mode brut, puis
mettre à jour le commit épinglé et les empreintes dans `manifest.json`. Les
fichiers téléchargés ne se committent toujours pas.
Original file line number Diff line number Diff line change
@@ -0,0 +1,133 @@
{
"corpus": "LOGIC",
"tranche": "C",
"issue": 17578,
"epic": 10355,
"criteria_comment": "https://github.com/jsboige/CoursIA/issues/17578#issuecomment-6073752732",
"acquired_utc": "2026-10-10",
"committed_to_repo": false,
"why_not_committed": "no verifiable license at the source (API license null, no LICENSE file, no README mention); third-party MIT attestations unverifiable; CoursIA is a public repo",
"consumption_route": "deterministic fetch at execution, pinned by upstream commit, verified against sha256 before use (alternative: out-of-repo GDrive path)",
"fetch_url_template": "https://raw.githubusercontent.com/causalNLP/logical-fallacy/{commit}/data/{file}",
"upstream": {
"repo": "https://github.com/causalNLP/logical-fallacy",
"commit": "2a3d09708122c0994279df034d867b80950700ea",
"is_default_branch_head": true
},
"license": {
"name": null,
"repo_license_file": null,
"readme_license_mention": null,
"api_license_field": null,
"rejected_evidence": "third-party 'MIT (c) 2022 Zhijing Jin' attestations from downstream repo lfx, unverifiable against the source repository",
"paper": "Jin, Lalwani, Vaidhya, Shen, Ding, Lyu, Sachan, Mihalcea, Schölkopf (2022), Logical Fallacy Detection, arXiv:2202.13758",
"paper_deposited_at": "G:\\Mon Drive\\MyIA\\IA\\Bibliographie IA\\Argumentation\\Fallacy Theory & Informal Logic\\2022 - Jin et al - Logical Fallacy Detection (arXiv 2202.13758).pdf",
"measured_by": [
"myia-po-2026:CoursIA 2026-10-09 (issue comment 6073752732)",
"myia-po-2025:CoursIA 2026-10-10 (this pinning)"
]
},
"fingerprint_note": "blob_sha1 computed with git hash-object --no-filters: two upstream blobs carry CRLF (edu_test.csv: 2, mappings.csv: 14) that a hash under core.autocrlf=true would silently normalize, yielding a SHA that differs from upstream",
"files": {
"mappings.csv": {
"source_path": "data/mappings.csv",
"blob_sha1": "73b961a6707aff6cb5ee575a4488f1c7eb56b04b",
"sha256": "2f8f787aa4e29ab50bd17b5d3e0fe27d15c5a489e2c04508bf810bc4dba767db",
"bytes": 5034,
"crlf_count": 14,
"consumed_by_alignment": true,
"role": "academic taxonomy: original name, understandable name, description, logical form, masked logical form"
},
"edu_all.csv": {
"source_path": "data/edu_all.csv",
"blob_sha1": "59c58315212f4f338e5cf611f7fd0995eb6747cc",
"sha256": "bc03ca335524518b8eda3c63b97f45d15af3096de10fe1a4c3a890aabd7556a0",
"bytes": 768136,
"crlf_count": 0,
"consumed_by_alignment": true,
"role": "full labeled educational dataset (source text + fallacy label)"
},
"climate_all.csv": {
"source_path": "data/climate_all.csv",
"blob_sha1": "84fa005bb4283645a244ade8b069acaf05070a88",
"sha256": "c32b874d85b1cccf505b14c7a828b39a974247ff5b3040f03f0f4067c2908d48",
"bytes": 433309,
"crlf_count": 0,
"consumed_by_alignment": true,
"role": "full labeled climate dataset (source text + fallacy label)"
},
"edu_train.csv": {
"source_path": "data/edu_train.csv",
"blob_sha1": "07e4e346336a89134dc46067f2f3882615e4d305",
"sha256": "0c6377dbf744ba85e60102eb9842cc770f385afcb2724f607e8e8a99f5d9545c",
"bytes": 633843,
"consumed_by_alignment": false,
"role": "train split, derivable from edu_all"
},
"edu_dev.csv": {
"source_path": "data/edu_dev.csv",
"blob_sha1": "c7baae3238a8949ec5f962152af8769fded47af0",
"sha256": "5c567eb12e604271d0ec10e456c5c0bedcf01bd8a2f56d84a5ca88744ece36af",
"bytes": 101869,
"consumed_by_alignment": false,
"role": "dev split, derivable from edu_all"
},
"edu_test.csv": {
"source_path": "data/edu_test.csv",
"blob_sha1": "e06d9639e8b286156b5ab1f4e6367a78665e66bf",
"sha256": "47f6b86ec6c5256e9db97844f86684dc1fdc72c593e14db230e532098f668534",
"bytes": 104740,
"crlf_count": 2,
"consumed_by_alignment": false,
"role": "test split, derivable from edu_all"
},
"climate_train.csv": {
"source_path": "data/climate_train.csv",
"blob_sha1": "1461db501ee4bde69dac91500c0b8967b2180f86",
"sha256": "31daeb6476f3db3b864f6f3a0a40a689ebd07310636e4b943199d3b7bc50d841",
"bytes": 274475,
"consumed_by_alignment": false,
"role": "train split, derivable from climate_all"
},
"climate_dev.csv": {
"source_path": "data/climate_dev.csv",
"blob_sha1": "08b1c700bb9c98f3def3430a7be1a4e26397ebe8",
"sha256": "cee102370d57d12118483bd70e4bdca9ce60de934f0668c4f037dee8ebbaf701",
"bytes": 96522,
"consumed_by_alignment": false,
"role": "dev split, derivable from climate_all"
},
"climate_test.csv": {
"source_path": "data/climate_test.csv",
"blob_sha1": "fa00317f8320796e58b9af44dffdd50e0a14764f",
"sha256": "16f296fb38e594f92512a8f05e6b8c526a978fafe9fce8f924faaf7ad7d3082a",
"bytes": 62406,
"consumed_by_alignment": false,
"role": "test split, derivable from climate_all"
},
"climate_train_mh.csv": {
"source_path": "data/climate_train_mh.csv",
"blob_sha1": "0386d2f1172c72c6a0101115bbca209b644d6cd2",
"sha256": "234925773fc98569d95ab033144cced96322e136bbd77eec78cc569f6034300b",
"bytes": 293050,
"consumed_by_alignment": false,
"role": "masked-hard variant of the train split"
},
"climate_dev_mh.csv": {
"source_path": "data/climate_dev_mh.csv",
"blob_sha1": "88ec786d4910c84261c5168728c79c90e2025303",
"sha256": "8cac0cd850f21750571bf29f193c46449f645ebc5bc9b32cfa126218f1f5664e",
"bytes": 100382,
"consumed_by_alignment": false,
"role": "masked-hard variant of the dev split"
},
"climate_test_mh.csv": {
"source_path": "data/climate_test_mh.csv",
"blob_sha1": "127fedeb2220bf912858410e91ccb70f4d9ebd9f",
"sha256": "985b2f7ea95b1310feaa086c3ff07a181981dd7ebcd073d58eed91153c61483e",
"bytes": 66285,
"consumed_by_alignment": false,
"role": "masked-hard variant of the test split"
}
}
}
Original file line number Diff line number Diff line change
@@ -0,0 +1,78 @@
NOTICE — CoursIA `data/academic/MAFALDA/`
==============================================================================

Ce répertoire est une copie verbatim de deux fichiers du dépôt amont MAFALDA
au commit épinglé **0df434477b914a20f55c0592ba05a53fe924c65b** (acquis le
2026-10-10, tranche C de l'issue #17578, EPIC #10355 — critères c.6073752732).

Dépôt source : https://github.com/ChadiHelwe/MAFALDA
Fichiers sources : `datasets/gold_standard_dataset.jsonl` (200 lignes)
`datasets/user_study_examples_with_labels.jsonl` (20 lignes)

Empreintes (mesurées à l'acquisition, identiques à l'amont au commit épinglé) :

Fichier SHA1 (blob git) SHA-256
gold_standard_dataset.jsonl 815be42647e5c7fde3656d1d... f714d58e7a21a66d63bc03ead98f376e2d9ab7a35d3f847d92ac1c2e0179004d
user_study_examples_with_labels.jsonl 90289f00fa49965ba38df65d... 88928bfb2ffc1e32882f5be404286206451a9feabcb17501a7a0dd52c8827fd3

Les SHA1 de blob complets et les tailles exactes vivent dans `manifest.json`
à côté de ce NOTICE.

Licence amont — support : le papier, jamais un fichier inexistant
-----------------------------------------------------------------

Le dépôt amont ne porte AUCUN fichier `LICENSE` et son README ne mentionne
aucune licence (mesuré par API GitHub le 2026-10-09, lane po-2026,
c.6073752732 ; re-mesuré le 2026-10-10 par la lane po-2025). La licence des
données est déclarée par les auteurs dans le papier :

Helwe, Calamai, Paris, Clavel, Suchanek — « MAFALDA: A Benchmark and
Comprehensive Study of Fallacy Detection and Classification », NAACL 2024,
arXiv:2311.09761 : « All our code and data are publicly available under a
CC-BY-SA license ».

Corroboration mesurée le 2026-10-10 : la fiche arXiv 2311.09761 porte
elle-même un lien de licence « view license » pointant CC BY-SA 4.0.

Conséquence (ShareAlike, critère 4 de la tranche C)
---------------------------------------------------

Toute dérivée committée dans CoursIA construite sur ces données (tables
d'alignement taxonomique, splits, extraits) est distribuée sous la même
marque **CC-BY-SA**, attribution conservée :

© Helwe et al. 2024 — CC BY-SA 4.0 (déclaration papier NAACL 2024,
arXiv:2311.09761).

Périmètre de la copie (critère 3 : ce qui est pris, ce qui ne l'est pas)
-----------------------------------------------------------------------

Pris verbatim : les deux fichiers ci-dessus — les seuls fichiers annotés du
dépôt qui servent l'alignement taxonomique académique ↔ Argumentum.

Non pris :
- `datasets/non_annotated_dataset.jsonl` (5,7 Mo, textes sources sans
étiquettes — hors besoin de l'alignement) ;
- `datasets/users_results/` (résultats de l'étude utilisateur) ;
- `datasets/user_study_examples_without_labels.jsonl` (variante non
étiquetée d'un fichier pris) ;
- `MAFALDA_Annotation_Guidelines.pdf` — déposé au gisement bibliographique
GDrive partagé avec le papier (règle bibliography-hygiene), jamais
committé.

Copie verbatim
--------------

Identique octet pour octet à l'amont : LF purs (0 CRLF), UTF-8 sans BOM,
ASCII pur. La règle `-text` du `.gitattributes` racine (entrée dédiée)
empêche git de normaliser les fins de ligne : le blob stocké reste égal au
blob amont, vérifiable par `git ls-files -s` contre les SHA1 ci-dessus.

Resynchronisation
-----------------

Re-télécharger depuis le dépôt amont au nouveau commit
(`https://raw.githubusercontent.com/ChadiHelwe/MAFALDA/<commit>/datasets/<fichier>`),
vérifier les empreintes, puis mettre à jour le commit épinglé dans ce NOTICE
et dans `manifest.json`. Ne jamais éditer les `.jsonl` à la main : la copie
cesserait d'être verbatim et l'empreinte ne correspondrait plus.
Loading
Loading