@ElenLeFoll "Would you teach a statistics course next semester?" "Err ..."
I can't recommend @ProfAndyField's books highly enough. I'd probably wait for the next edition of "Discovering Statistics Using R", though. @BodoWinter's book is also very good!
@isoglosse @ladida_lisa Der Duden hat noch mehr auf Lager:
https://t.co/b8drGh54gg
https://t.co/OBMtPngtJk
https://t.co/iRQNRZST4N
Ich vermute ebenfalls, dass das mit dem Zeitpunkt der Übernahme zu tun hat. (Der -e-Plural kommt mir selbst auch überall seltsam vor.)
@neele_engelmann @ladida_lisa I honestly don't know. So far, I can only tell you that rnorm_pre() will lead to a different distribution of mean differences (higher sd).
@notesJOR Woran machst du's denn fest? Wenn Teile von woanders übernommen wurden, könnte z.B. eine stilometrische Analyse diesen Verdacht untermauern (siehe z.B. https://t.co/FYJRmjVPWl) und es erleichtern, die fraglichen Teile zu identifizieren.
@nadystructions "Frei wovon? Was schiert das Zarathustra! Hell aber soll mir dein Auge künden: frei wozu?"
(Wenig überraschend aus "Also sprach Zarathustra".)
@notesJOR @sascha_wolfer Zum Herumspielen: Ich habe vor einer Weile mal das hier gebastelt, um den Einfluss von Textlänge/Fenstergröße auf Wertebereich und Rankings von Texten für verschiedene Maße zu berechnen: https://t.co/NHPkmH2Jqd
Textbasis ist hier das Romankorpus aus dem Kallimachos-Projekt.
@notesJOR @sascha_wolfer Wenn ich mich kurz einmischen darf: MTLD ist tatsächlich relativ textlängenunabhängig, aber nicht großartig was anderes, als das mittlere Type-Token-Verhältnis für kleine Fenstergrößen zu berechnen. Was bei STTR der Einfluss der Fenstergröße ist, ist bei MTLD die Faktorgröße.
@ladida_lisa @WatchedPotts Oh, we didn't actually scrape Reddit, we just used the Pushshift data dumps (https://t.co/TIyas7ShfH). The website seems to be down at the moment, though.